arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2604.09494 2026-04-13 cs.CL cs.AI cs.IR cs.LG 62%

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

RecaLLM:通过显式上下文检索解决‘思维迷失’现象

Kyle Whitecross, Negin Rahimi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RecaLLM通过交替推理与显式上下文检索解决推理过程中因长上下文导致的检索性能下降问题,显著提升了RULER和HELMET基准测试表现。

Comments Code, data, and models available at https://github.com/kswhitecross/RecaLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI 62%

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08956 2026-04-13 cs.CV cs.LG 62%

Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift

低数据监督适应在云分割领域优于提示

Harshith Kethavath, Weiming Hu

机构 * University of Georgia(佐治亚大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了在遥感影像云分割任务中,低数据监督微调优于提示方法,发现使用少量标注数据可显著提升性能,而提示方法效果有限。

Comments 10 pages, 6 figures, to be published in EarthVision @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08536 2026-04-10 cs.CV cs.AI 62%

RewardFlow: Generate Images by Optimizing What You Reward

RewardFlow: 通过优化所奖励的内容生成图像

Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant Shah, Ayush Barik, Nabeel Bashir, Muntasir Wahed, Ritish Shrirao, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sony Research, India(索尼印度研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 RewardFlow通过多奖励Langevin动力学优化预训练扩散和流匹配模型,统一了语义对齐、感知保真度等不同可微奖励,并引入基于VQA的可微奖励提升语义监督。

Comments CVPR 2026. Project page: https://plan-lab.github.io/rewardflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08337 2026-04-10 cs.CV cs.AI 62%

InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding

InstAP:面向空间-时间理解的实例感知视觉-语言预训练

Ashutosh Kumar, Rajat Saini, Jingjing Pan, Mustafa Erdogan, Mingfang Zhang, Betty Le Dem, Norimasa Kobori, Quan Kong

机构 * Woven by Toyota

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 InstAP通过结合全局视觉-文本对齐与细粒度实例级对比对齐,提升实例级推理能力,在InstVL数据集上实现优于现有VLP模型的实例检索性能,并在零样本视频基准中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08000 2026-04-10 cs.AI cs.CL cs.CV cs.HC cs.MA 62%

PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory

PASK:迈向具有长期记忆的意图感知主动代理

Zhifei Xie, Zongzheng Hu, Fangda Ye, Xin Zhang, Haobo Chai, Zihang Liu, Pengcheng Wu, Guibin Zhang, Yue Liao, Xiaobin Hu, Deheng Ye, Chunyan Miao, Shuicheng Yan

机构 * Pask-Core(Pask核心) NTU(南洋理工大学) NUS(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PASK框架,通过意图流模型和混合记忆系统实现主动代理,在现实场景中识别更深层用户意图。

Comments Technical report; Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06770 2026-04-09 cs.CV cs.AI 62%

FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts

FlowExtract:从维护流程图中提取过程知识

Guillermo Gil de Avalle, Laura Maruster, Eric Sloot, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Philips Consumer Lifestyle B.V.(飞利浦消费生活方式有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlowExtract,通过分离元素检测与连接性重建,利用YOLOv8和EasyOCR提取标准流程图节点,结合新边检测方法实现高精度连接提取,优于视觉语言模型基线,为可查询的过程知识表示提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13354 2026-04-09 cs.CV cs.LG 62%

AgriPath: A Systematic Exploration of Architectural Trade-offs for Crop Disease Classification

AgriPath:作物疾病分类架构权衡的系统探索

Hamza Mooraj, George Pantazopoulos, Alessandro Suglia

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文系统比较了CNN、对比视觉语言模型和生成式VLM在作物疾病分类中的表现,揭示了不同架构在不同场景下的性能差异,强调部署环境对架构选择的影响。

Comments 11 pages main text, 24 pages total including references and appendix. 6 figures, 14 tables. Code and dataset will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 62%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04681 2026-04-07 cs.LG cs.CV 62%

Batch Loss Score for Dynamic Data Pruning

批量损失评分用于动态数据剪枝

Qing Zhou, Bingxuan Zhao, Tao Yang, Hongyuan Zhang, Junyu Gao, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出批量损失评分(BLS),通过指数移动平均法高效计算样本重要性,简化代码集成并提升复杂模型的数据剪枝效果。

Comments CVPR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13130 2026-04-07 cs.CV cs.AI cs.CL 62%

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03315 2026-04-07 cs.CV cs.AI 62%

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜

Bingliang Li, Zhenhong Sun, Jiaming Bian, Yuehao Wu, Yifu Wang, Hongdong Li, Yatao Bian, Huadong Mo, Daoyi Dong

机构 * Independent Researcher(独立研究员) Australia National University(澳大利亚国立大学) Central South University(中南大学) University of New South Wales(新南威尔士大学) Vertex Lab(Vertex实验室) National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03240 2026-04-07 cs.LG cs.AI cs.CL 62%

Scaling DPPs for RAG: Density Meets Diversity

在RAG中扩展DPPs:密度与多样性

Xun Sun, Baiheng Xie, Li Huang, Qiang Gao

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScalDPP,通过轻量级P-Adapter整合DPPs,实现RAG中密度与多样性的联合优化,通过DML损失确保互补证据链的优先级,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02593 2026-04-06 cs.CV cs.AI 62%

Moondream Segmentation: From Words to Masks

月梦分割:从词语到掩码

Ethan Reid

机构 * M87 Labs, San Francisco, CA, USA(M87实验室,美国加利福尼亚州旧金山)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 月梦分割基于Moondream 3扩展,通过自回归解码生成掩码并迭代优化,引入强化学习阶段提升分割精度,实现RefCOCO和LVIS数据集的高精度分割结果。

Comments Demo: https://moondream.ai/me/playground

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02479 2026-04-06 cs.CV cs.AI 62%

Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI

通过掩码条件生成式AI生成卫星图像数据用于野火检测

Valeria Martin, K. Brent Venable, Derek Morgan

机构 * Department of Intelligent Systems and Robotics, University of West Florida(西佛罗里达大学智能系统与机器人系) IHMC(人类与机器认知研究所)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了基于地球观测扩散模型EarthSynth生成野火后Sentinel-2 RGB图像的可能性,通过不同实验配置评估生成效果,发现修补生成优于全图生成,且VLM辅助修补与手工提示效果相当。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17677 2026-04-06 cs.CL cs.AI cs.LG 62%

Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models

适应性引导的检索增强掩码扩散模型

Jaemin Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01987 2026-04-03 cs.CV cs.LG 62%

Curia-2: Scaling Self-Supervised Learning for Radiology Foundation Models

Curia-2:用于放射学基础模型的自监督学习扩展

Antoine Saporta, Baptiste Callard, Corentin Dancette, Julien Khlaut, Charles Corbière, Leo Butsanets, Amaury Prat, Pierre Manceron

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29777 2026-04-01 cs.CV cs.AI 62%

From Skeletons to Semantics: Design and Deployment of a Hybrid Edge-Based Action Detection System for Public Safety

从骨架到语义:一种混合边缘基于的动作检测系统在公共安全中的设计与部署

Ganen Sethupathy, Lalit Dumka, Jan Schagen

机构 * Sopra Steria Germany(Sopra Steria德国) Sopra Steria India(Sopra Steria印度)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种混合边缘动作检测系统,结合骨架运动分析与视觉语言模型,以提升公共安全中的实时视频分析能力,通过系统级对比展示两种方法在边缘计算中的互补性与局限性。

Comments Preprint version of a manuscript currently under review at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 62%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08026 2026-03-31 cs.CV cs.AI cs.CL 62%

FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures

FigEx2: 科学复合图像的视觉条件化面板检测与标注

Jifeng Song, Arun Das, Pan Wang, Hui Ji, Kun Zhao, Yufei Huang

机构 * University of Pittsburgh(匹兹堡大学) UPMC Hillman Cancer Center(UPMC希尔曼癌症中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对科学复合图像中缺乏标注的问题,FigEx2通过视觉条件化框架直接从图像生成面板标注,提升下游预训练和检索性能,同时引入噪声感知门控融合模块和分阶段SFT+RL策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21428 2026-03-31 cs.CV cs.AI cs.RO 62%

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13516 2026-03-31 cs.CV cs.AI 62%

Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection

双向多模态提示学习与尺度感知训练用于少样本多类异常检测

Yujin Lee, Sewon Kim, Daeun Moon, Seoyoon Jang, Hyunsoo Yoon

机构 * Yonsei University(延世大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG 62%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO 62%

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26052 2026-03-30 cs.CV cs.AI 62%

Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification

像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合

Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10983 2026-03-30 cs.CV cs.AI 62%

Binary Verification for Zero-Shot Vision

零样本视觉的二元验证

Rongbin Hu, Jeffrey Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需训练的二元验证流程,通过量化和二元化步骤提升零样本视觉任务性能,适用于引用表达定位、空间推理和BLINK-Jigsaw等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23517 2026-03-26 cs.LG cs.AI cs.CL cs.SC 62%

Beyond Accuracy: Introducing a Symbolic-Mechanistic Approach to Interpretable Evaluation

超越准确度:引入符号-机械方法进行可解释性评估

Reza Habibi, Darian Lee, Magy Seif El-Nasr

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符号-机械方法,通过结合任务相关符号规则与机械可解释性,评估模型在小数据下的泛化能力,揭示传统准确度指标无法检测的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15087 2026-03-26 cs.CV cs.CL cs.LG 62%

Phrase-Instance Alignment for Generalized Referring Segmentation

短语-实例对齐用于通用指称分割

E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳州立大学 Charlotte 分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过短语-实例对齐解决通用指称分割问题,通过实例级推理和POA损失实现精确对应,提升分割性能。

Comments Accepted to PVUW - CVPR 2026 Workshop. Webpage: https://eronguyen.github.io/InstAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23030 2026-03-25 cs.CV cs.AI 62%

Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation

超越窗口:用于无训练开放词汇语义分割的全局-局部对齐CLIP

ByeongCheol Lee, Hyun Seok Seong, Sangeek Hyun, Gilhan Park, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(全北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GLA-CLIP框架,通过增强窗口间信息交换解决传统滑动窗口方法的语义不一致问题,引入代理锚点和动态归一化方案提升小目标检测性能。

Comments 18 pages, 13 figures, 12 tables, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22317 2026-03-25 cs.LG cs.AI 62%

Geometric Mixture-of-Experts with Curvature-Guided Adaptive Routing for Graph Representation Learning

具有曲率引导自适应路由的几何混合专家用于图表示学习

Haifang Cao, Yu Wang, Timing Li, Xinjie Yao, Pengfei Zhu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GeoMoE框架,通过Ollivier-Ricci曲率指导的自适应路由融合不同黎曼空间的节点表示,提升多尺度拓扑结构的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏