arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-15 至 2026-04-15 共收录 60 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 12 篇

2604.05818 2026-04-15 cs.CV cs.CL cs.IR 89%

WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering

WikiSeeker: 重新思考视觉语言模型在基于知识的视觉问答中的作用

Yingjian Zhu, Xinming Wang, Kun Ding, Ying Wang, Bin Fan, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室 (MAIS))

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出WikiSeeker框架,通过引入多模态检索器和重新定义视觉语言模型的角色,提升多模态检索性能和答案质量,实现在EVQA、InfoSeek和M2KR数据集上的最优表现。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12033 2026-04-15 cs.CL cs.AI cs.CV 89%

Benchmarking Deflection and Hallucination in Large Vision-Language Models

对大视觉-语言模型中偏移和幻觉的基准测试

Nicholas Moratelli, Christopher Davis, Leonardo F. R. Ribeiro, Bill Byrne, Gonzalo Iglesias

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Amazon AGI(亚马逊人工智能实验室) University of Cambridge(剑桥大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLM-DeflectionBench基准,通过2775个样本评估模型在冲突或不足证据下的行为,揭示模型在面对噪声或误导性证据时的偏移能力不足,为可靠的KB-VQA评估提供可扩展的基准。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11970 2026-04-15 cs.CV cs.AI cs.CL cs.LG 88%

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) Punjabi University(旁遮普大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 85%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20093 2026-04-15 cs.CV cs.AI 81%

StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback

StableSketcher: 通过视觉问答反馈增强扩散模型以生成基于像素的素描

Jiho Park, Sieun Choi, Jaeyoon Seo, Jihie Kim

机构 * Dongguk University(东国大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出StableSketcher框架,通过优化潜在解码和视觉问答反馈提升扩散模型生成手绘素描的逼真度和语义一致性。

Comments Under review at IEEE Access. Author-submitted preprint. Not the IEEE-published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10695 2026-04-15 cs.CV 79%

Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification

检索以恢复:通过语义一致的净化实现不完整音频-视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Nankai University(南开大学计算机学院) School of mathematics, Sun Yat-sen University(中山大学数学学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出R$^{2}$ScP框架,通过检索而非生成方法处理缺失模态,利用统一语义嵌入进行跨模态检索,并引入上下文感知适应净化机制,提升语义恢复能力,实验表明其在不完整模态场景中性能更优。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-04-15 cs.CV cs.LG 79%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 70%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11435 2026-04-15 cs.CL cs.AI cs.IR cs.LG 62%

Think Before you Write: QA-Guided Reasoning for Character Descriptions in Books

在写作前思考:基于问答的字符描述推理

Argyrios Papoudakis, Mirella Lapata, Frank Keller

机构 * Institute of Language, Cognition and Computation(语言、认知与计算研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种解耦推理与生成的框架,通过问答引导推理提升字符描述的准确性、信息量和现实基础。

Comments 20 pages, 16 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 57%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12208 2026-04-15 cs.RO cs.AI 57%

Unveiling the Surprising Efficacy of Navigation Understanding in End-to-End Autonomous Driving

揭示端到端自动驾驶中导航理解的惊人效能

Zhihua Hua, Junli Wang, Pengfei LI, Qihao Jin, Bo Zhang, Kehua Sheng, Yilun Chen, Zhongxue Gan, Wenchao Ding

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Didi Chuxing(滴滴出行) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出SNG框架,通过真实导航模式高效表示全局导航信息,结合导航路径与分步信息,提升自动驾驶的全局与局部规划能力,实现无需辅助损失函数的高精度导航建模。

Comments 8 pages, 6 figures. ICRA 2026. Code available at https://fudan-magic-lab.github.io/SNG-VLA-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12185 2026-04-15 cs.CL 50%

Knowledge Is Not Static: Order-Aware Hypergraph RAG for Language Models

知识并非静态:面向语言模型的顺序感知超图RAG

Keshu Wu, Chenchen Kuai, Zihao Li, Jiwan Jiang, Shiyu Shen, Shian Wang, Chan-Wei Hu, Zhengzhong Tu, Yang Zhou

机构 * Texas A&M University(德克萨斯大学A&M分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Kansas(堪萨斯大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出顺序感知超图RAG(OKH-RAG),通过将顺序作为结构属性,改进传统RAG方法,提升对顺序敏感任务的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2604.12630 2026-04-15 cs.CV cs.CL 91%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00710 2026-04-15 cs.AI 85%

Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models

RLVR能否扩展推理边界?探究视觉-语言模型中的能力扩展

Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu

机构 * University College London(伦敦大学学院) Samsung R&D Institute UK(三星英国研发院) University of California, Los Angeles(加州大学洛杉矶分校) Texas A&M University(德克萨斯农工大学) Imperial College London(伦敦帝国学院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过Ariadne框架研究RLVR对视觉-语言模型空间推理能力的影响,证明其能扩展推理边界,并在真实导航任务中取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13035 2026-04-15 cs.CV cs.CL 77%

SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis

SceneCritic: 一种用于3D室内场景合成的符号评估器

Kathakoli Sengupta, Kai Ao, Paola Cascante-Bonilla

机构 * Stony Brook University(石溪大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出SceneCritic,一种基于空间本体的符号评估器,用于评估3D室内场景合成的语义、方向和几何一致性,通过不同批评模式验证模型的空间结构构建与修正能力。

Comments Project Page: https://lab-spell.github.io/SceneCritic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22799 2026-04-15 cs.CV 77%

VPTracker: Global Vision-Language Tracking via Visual Prompt

VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪

Jingchao Wang, Kaiwen Zhou, Zhijian Wu, Kunhua Ji, Dingjiang Huang, Yefeng Zheng

机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 70%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 62%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG 62%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00181 2026-04-15 cs.CV cs.AI 62%

CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning

CamReasoner:通过结构化空间推理强化相机运动理解

Hang Wu, Yujun Cai, Zehao Li, Haonan Ge, Bowen Sun, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) University of Queensland(昆士兰大学) Ant Group(蚂蚁集团) University of Chinese Academy of Sciences(中国科学院大学) University at Buffalo, State University of New York(纽约州立大学布法罗分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 CamReasoner通过结构化推理框架提升相机运动理解,采用O-T-A范式和大规模推理轨迹集,首次利用强化学习实现逻辑对齐,提升分类和VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12512 2026-04-15 cs.CV cs.AI 62%

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1)

Guanyi Qin, Jie Liang, Bingbing Zhang, Lishen Qu, Ya-nan Guan, Hui Zeng, Lei Zhang, Radu Timofte, Jianhui Sun, Xinli Yue, Tao Shao, Huan Hou, Wenjie Liao, Shuhao Han, Jieyu Yuan, Chunle Guo, Chongyi Li, Zewen Chen, Yunze Liu, Jian Guo, Juan Wang, Yun Zeng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Xinjie Zhang, Qiang Li, Li Yan, Wei Dong, Qingsen Yan, Xingcan Li, Shenglong Zhou, Manjiang Yin, Yinxiang Zhang, Hongbo Wang, Jikai Xu, Zhaohui Fan, Dandan Zhu, Wei Sun, Weixia Zhang, Kun Zhu, Nana Zhang, Kaiwei Zhang, Qianqian Zhang, Zhihan Zhang, William Gordon, Linwei Wu, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Cici Liu, Yaokun Shi

机构 * NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)(NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NTIRE 2026挑战赛,聚焦专业图像质量评估,通过多模态大语言模型提升图像评估的准确性与解释性,吸引200多团队参与,推动专业IQA领域的发展。

Comments NTIRE Challenge Report. Accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12659 2026-04-15 cs.LG cs.CL 57%

Do VLMs Truly "Read" Candlesticks? A Multi-Scale Benchmark for Visual Stock Price Forecasting

视觉语言模型真的能‘解读’K线图吗?一种多尺度的视觉股票价格预测基准

Kaiqi Hu, Linda Xiao, Shiyue Xu, Ziyi Tang, Mingwen Liu

机构 * University of Leeds(利兹大学) Sun Yat-sen University(中山大学) Likelihood Lab(Likelihood实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出多尺度K线图基准,评估视觉语言模型对多尺度视觉市场动态的理解能力,发现大多数模型在持续上涨或下跌时表现良好,但在常见市场场景中预测能力较弱。

Comments We evaluate whether VLMs can comprehend multi-scale visual stock price data like human analysts with a proposed benchmark, identifying current VLMs' weak predictive power, significant biases, and limited sensitivity to forecast horizons and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11047 2026-04-15 cs.CL cs.LG 57%

CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs

CoG:通过关系蓝图和故障感知细化实现可控图推理

Yuanxiang Liu, Songze Li, Xiaoke Guo, Zhaoyan Gong, Qifei Zhang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 本文提出CoG框架,通过关系蓝图和故障感知细化模块,解决知识图谱中推理稳定性与效率问题,实验显示其在准确性和效率上均优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14512 2026-04-15 cs.CV 57%

SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks

SIRI-Bench: 通过复杂推理任务挑战VLMs的空间智能

Zijian Song, Xiaoxin Lin, Qiuming Huang, Sihan Qin, Guangrun Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 SIRI-Bench通过空间接地推理任务评估VLMs的空间结构智能,包含9000个视频问题答案三元组,实验表明先进VLMs在结构空间推理上面临挑战。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 12 篇

2604.12424 2026-04-15 cs.CL cs.AI cs.CV 86%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12346 2026-04-15 cs.CV 85%

Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization

解锁 grounding dino 在视频中的潜力:针对小数据空间-时间定位的参数高效适应

Zanyi Wang, Fan Li, Dengyang Jiang, Liuzhuozheng Li, Yunhua Zhong, Guang Dai, Mengmeng Wang

机构 * SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室,国家电网公司) University of HongKong(香港大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出ST-GD框架,通过冻结基础模型并注入轻量适配器,有效解决小数据下的视频空间时间定位问题,在HC-STVG v1/v2基准和VidSTG数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12387 2026-04-15 q-bio.GN 80%

oxo-call: Documentation-grounded Skill Augmentation for Accurate Bioinformatics Command-line Generation with Large Language Models

oxo-call:基于文档的技能增强用于准确的生物信息学命令行生成与大型语言模型

Yun Peng, Yujun Sun, Jia Ding, Bin Yan, Zhangyu Wang, Chunyang Wang, Chenyang Shu, Jian-Guo Zhou, Shixiang Wang

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract)

AI总结 oxo-call通过文档优先 grounding 和精选技能增强策略,提升生物信息学命令行生成的准确性,提供150+内置技能和可扩展的流程引擎。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12357 2026-04-15 cs.AI cs.CV 79%

ReflectCAP: Detailed Image Captioning with Reflective Memory

ReflectCAP: 基于反思记忆的详细图像描述

Kyungmin Min, Minbeom Kim, Kang-il Lee, Seunghyun Yoon, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI) Dept. of ECE, Seoul National University(首尔国立大学电子与计算机工程系) Adobe Research(Adobe研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);InternVL(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ReflectCAP通过反思笔记指导生成详细且准确的图像描述,平衡事实性和覆盖性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12508 2026-04-15 cs.CV 70%

From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception

从衰减到注意:用于细粒度视觉感知的变分信息流操控

Jilong Zhu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院(ICT/CAS)) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院(ICT/CAS)) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出变分信息流框架,通过建模问题-答案对相关的视觉显著性作为潜在分布,解决多模态大语言模型在细粒度感知任务中的信息衰减问题,提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12440 2026-04-15 cs.CV cs.AI 62%

IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation

IAD-Unify:一种基于区域的统一模型用于工业异常分割、理解和生成

Haoyu Zheng, Tianwei Lin, Wei Wang, Zhuonan Wang, Wenqiao Zhang, Jiaqi Zhu, Feifei Shao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IAD-Unify模型,通过双重编码框架实现工业异常的分割、理解和生成,构建了统一的评估平台,并展示了其在跨类别泛化上的强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏