arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-31 至 2026-07-31 共收录 60 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2607.27304 2026-07-31 cs.LG cs.CV 新提交 89%

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) School of UEMK Kolkata(UEMK Kolkata学院) Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)

专题命中 视觉问答 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28318 2026-07-31 cs.AI 新提交 85%

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?

Zongyi Chen, Yu Liang, Jie Lin, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 81%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 77%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 视觉问答 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交 77%

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);MLLM(abstract_cn);分类 cs.LG

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27830 2026-07-31 cs.CV 新提交 70%

Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

一次思考足矣:面向高分辨率视觉问答的中间层证据路由

Zhongkuan Mao, Xianjie Liu, Tianyu Meng, Yidong Wang, Wenzhuo Zhao, Ronghao Xian, Yao Jiang, Fei Shen, Junfeng Fang, Yong Dai, Yi Zhang, Keren Fu

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27506 2026-07-31 cs.CL cs.AI 新提交 70%

Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models

极简RAG的模型:B1ade 335M嵌入模型与1B参数小型语言模型

Shreyas Subramanian, Mecit Gungor, Vikram Elango

机构 * Amazon(亚马逊公司)

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出含B1ade-embed嵌入模型与B1ade-1B小型语言模型的高效极简RAG架构,其在多QA基准及RAG评估中表现优异,还涌现出无明确监督的来源引用能力,验证了资源高效RAG的可行路径。

Comments 28 pages, 3 figures. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27826 2026-07-31 cs.AI cs.CV 新提交 62%

Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language Understanding

手语问答:手语理解的新任务、基准与基线模型

Shiwei Gan, Lichen Wang, Xiao Liu, Yafeng Yin, Kuizhuang Liu, Sanglu Lu, Lei Xie

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27260 2026-07-31 cs.LG 新提交 57%

Regularizing modality contribution drift in multimodal continual learning

多模态持续学习中模态贡献漂移的正则化

Zhen Zhang, Jielei Chu, Bin Liu, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

AI总结 针对多模态持续学习中的模态贡献漂移问题,提出含基于重放和无重放版本的CMCDR方法,经实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2607.28595 2026-07-31 cs.CV 新提交 87%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 视觉推理 :visual reasoning(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交 81%

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 77%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28154 2026-07-31 cs.CV cs.AI 新提交 62%

OPLD: On-Policy Latent Distillation for Multimodal Reasoning

OPLD:用于多模态推理的在线策略隐层蒸馏

Shoutai Zhu, Tianyang Xu, Bin Sun, Mingyuan Xu, Yu Liu, Qinzhen Guo

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OPLD框架,将多模态CoT的推理能力迁移至隐层表征,经多模态基准实验,其性能优于现有隐层推理方法,达到当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27895 2026-07-31 cs.AI cs.CV 新提交 62%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27798 2026-07-31 cs.AI 新提交 57%

MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容

Weihang Wang, Kainan Tu, Jielei Zhang, Run Yang, Boheng Sheng, Yuchen He, Yu Xie, Pengyu Chen, Peiyi Li, Huyang Sun, Longwen Gao, Zhouhui Lian

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。

Comments 17 pages, 5 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-07-31 cs.CL cs.AI 新提交 57%

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 18 篇

2607.27823 2026-07-31 cs.CV 新提交 91%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27558 2026-07-31 cs.CV cs.AI 新提交 84%

Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings

Drawing-Recode:基于栅格2D CAD图纸的参数化CAD代码生成的标注定位方法

Mingi Kim, Yongjun Kim, Hyungki Kim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 Drawing-Recode是一种从栅格2D CAD图纸生成参数化CAD代码的框架,通过图像编码器、文本识别模块、交叉注意力与AGL实现标注定位,性能优于基线且对工业扫描图纸鲁棒,可助力制造自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交 83%

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 82%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 81%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 81%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28367 2026-07-31 cs.AI 新提交 70%

How Benchmarks Mis-Score Computer-Use Agents

基准测试如何错误评估计算机使用智能体

Zihan Dong, Zhiyuan Ma, Zekun Wang, Yunqing Li, Zirou Liu, Ruixuan Deng, Qishi Zhan, Rui Qian

机构 * Georgia Institute of Technology(佐治亚理工学院) North Carolina State University(北卡罗来纳州立大学) Lenovo AI Technology Center(联想人工智能技术中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Marquette University(马凯特大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究指出计算机使用智能体的基准测试分数存在可靠性问题,审计150条轨迹发现15.3%的“失败”判定错误,进而推导了CUA评估各阶段的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-07-31 cs.CV 新提交 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28618 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 62%

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

AskChem:面向化学文献综合的以主张为中心的基础设施

Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho

机构 * New York University(纽约大学) Matterstack, Inc.(Matterstack公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28509 2026-07-31 cs.CV 新提交 57%

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

RefCaptioner:多参考图像接地的视频字幕生成

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。

Comments https://github.com/pkucs-Ltf/RefCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28087 2026-07-31 cs.AI 新提交 57%

Diversifying Personalized Research Ideation against AI-Induced Homogenization

针对AI引发的同质化问题实现个性化研究构思的多样化

Rui Xu, Yunke Wang, Linwei Tao, Wenjie Xuan, Yong Luo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27865 2026-07-31 cs.CV 新提交 57%

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

通过鲁棒3D化身放置学习理解肢体语言

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

机构 * National University of Science and Technology “Politehnica” Bucharest(布加勒斯特理工国立大学) “Simion Stoilow” Institute of Mathematics of the Romanian Academy(罗马尼亚科学院“西米翁·斯托伊洛夫”数学研究所) NORCE Norwegian Research Centre AS(挪威NORCE研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 该研究推出Drones2BodyLanguage数据集,结合轻量几何世界模型训练12种架构,可提升空中机器人对人类交际意图的感知准确率,为社交智能无人机提供数据支撑与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27537 2026-07-31 cs.CV 新提交 57%

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27450 2026-07-31 cs.LG 新提交 57%

Neural Network-Assisted CLEAN for Channel Modeling in Low-SNR Regimes

低信噪比环境下基于神经网络辅助CLEAN的信道建模

Chaofan Deng, Linyu Sun, Jaeho Lee, Arijit Raychowdhury

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对低信噪比信道建模,该研究提出混合框架NN-CLEAN,结合神经网络与CLEAN算法,在5dB SNR下精度超96%,计算复杂度大幅降低,可作为MIMO系统实时信道估计方案。

详情

展开后加载摘要…

URL PDF HTML 收藏