arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-11 至 2026-05-11 共收录 97 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2605.02881 2026-05-11 cs.RO 75%

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06747 2026-05-11 cs.CV cs.RO 70%

HumanNet: Scaling Human-centric Video Learning to One Million Hours

HumanNet: 将以人为中心的视频学习扩展到一百万小时

Yufan Deng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 HumanNet通过构建大规模人类活动视频数据集,探索以人为中心的视频在扩展具身基础模型中的潜力,展示其在动作生成和人机转移中的优势。

Comments Github: https://github.com/DAGroup-PKU/HumanNet Project website: https://dagroup-pku.github.io/HumanNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 57%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07088 2026-05-11 cs.CR 50%

Membership Inference Attacks on Vision-Language-Action Models

针对视觉-语言-动作模型的成员推断攻击

Yuefeng Peng, Mingzhe Li, Kejing Xia, Renhao Zhang, Amir Houmansadr

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文首次系统研究了针对视觉-语言-动作(VLA)模型的成员推断攻击(MIAs),提出了样本级和轨迹级的攻击设置,并展示了在多个VLA基准和模型上,攻击方法在黑盒环境下表现出色,揭示了VLA模型在隐私方面的高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 7 篇

2605.07447 2026-05-11 cs.CV cs.AI cs.CL cs.LG 86%

Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs

稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙

Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara

机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) Waseda University(早稻田大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08031 2026-05-11 cs.CV 79%

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

面向视觉语言模型的无对象幻觉强化反学习

Kaidi Jia, Yujie Lin, Chengyi Yang, Jiayao Ma, Jinsong Su

机构 * Xiamen University(厦门大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HFRU框架,通过视觉编码器深度语义删除,结合对齐破坏与GRPO优化,实现高效反学习,减少对象幻觉,实验显示在目标识别和人脸识别任务中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 78%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07250 2026-05-11 cs.CV cs.AI 76%

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

专题命中 幻觉与鲁棒性 :MLLM(title);分类 cs.CV、cs.AI

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG 70%

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07338 2026-05-11 cs.CV 57%

ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs

ShellfishNet:面向海洋软体动物视觉识别的领域专用基准数据集

Ziheng Zhou, Yang Wang, Nan Wang, Chengliang Wu, Jun Yan

机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) Fudan University(复旦大学) DP Technology(DP技术)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文构建了ShellfishNet数据集,包含8691张图像,用于评估视觉模型在真实环境下的泛化能力,测试了80种神经网络模型及多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI 57%

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 20 篇

2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 85%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL 85%

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07490 2026-05-11 cs.CR 85%

Cross-Modal Backdoors in Multimodal Large Language Models

多模态模型中的跨模态后门

Runhe Wang, Li Bai, Haibo Hu, Songze Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25584 2026-05-11 cs.AI cs.CL cs.CV cs.IT cs.LG math.IT 82%

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

跳过层?视觉-语言模型中层跳过的理论条件

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校) Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校) AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出统一框架,通过可验证的冗余概念,理论分析视觉-语言模型中层跳过的条件,验证早期和晚期视觉token的冗余性,并统一现代层跳技术的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07019 2026-05-11 cs.CV cs.AI 79%

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

LensVLM:压缩文本视觉表示的选取性上下文扩展

Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 LensVLM通过选择性上下文扩展提升压缩视觉表示的准确性,在4.3倍压缩下表现优异,且在多模态任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV 77%

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07367 2026-05-11 cs.RO cs.CV 77%

Weather-Robust Scene Semantics with Vision-Aligned 4D Radar

具有视觉对齐4D雷达的抗天气场景语义

Kali Hamilton, Christoffer Heckman

机构 * Autonomous Robotics and Perception Group(自主机器人与感知组)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出通过冻结视觉语言模型将雷达编码器对齐于SigLIP嵌入,以提升恶劣天气下的场景语义理解,实验表明雷达配置在雾、轻雪和重雪条件下优于相机基线。

Comments 5 pages + references, 2 appendix pages. ICRA 2026 Radar in Robotics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08029 2026-05-11 cs.CV cs.LG 73%

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

STARFlow2:连接语言模型与归一化流以实现统一的多模态生成

Ying Shen, Tianrong Chen, Yuan Gao, Yizhe Zhang, Yuyang Wang, Miguel Ángel Bautista, Shuangfei Zhai, Joshua M. Susskind, Jiatao Gu

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出STARFlow2,通过归一化流与预训练视觉语言模型结合,实现高效的多模态生成,采用深度浅层流设计和统一FAE潜在空间,提升生成效率与性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05848 2026-05-11 cs.CV cs.AI 73%

VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

VideoRouter: 为高效长视频理解的查询适应双路由

Kuanwei Lin, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 VideoRouter通过双路由框架实现高效长视频理解,通过语义路由和图像路由动态分配证据,减少冗余token,提升压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07355 2026-05-11 cs.CV cs.AI 73%

TTF: Temporal Token Fusion for Efficient Video-Language Model

TTF: 时空融合用于高效的视频-语言模型

Simin Huo, Ning LI

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出TTF方法,通过利用视频中的时间冗余性,减少视频语言模型的推理成本,保留高精度的同时显著降低视觉token数量。

Comments 14 pages; manuscript submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06175 2026-05-11 cs.RO 67%

VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts

VLA-GSE: 提升VLA中基于通用和专用专家的参数高效微调

Yuhua Jiang, Junjie Lu, Xinyao Qin, Xiaoyu Chen, Kaixin Wang, Feifei Gao, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 VLA-GSE通过通用和专用专家机制提升VLA在机器人控制中的参数高效微调效果,保留预训练知识的同时提高适应能力,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07299 2026-05-11 cs.CV cs.AI 62%

EgoPro-Bench: Benchmarking Personalized Proactive Interaction in Egocentric Video Streams

EgoPro-Bench:基于眼动视频流的个性化主动交互基准测试

Dongchuan Ran, Linyu Ou, Xueheng Li, Wenwen Tong, Chenxu Guo, Hewei Guo, Kaibing Wang, Lewei Lu

机构 * Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoPro-Bench,通过模拟用户画像生成多样化意图,构建高保真人机交互数据,评估主动交互能力,提升多模态大语言模型的意图理解与交互时机识别能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07274 2026-05-11 cs.AI cs.LG 62%

Structured Role-Aware Policy Optimization for Multimodal Reasoning

结构化角色感知策略优化用于多模态推理

Bingqing Jiang, Difan Zou

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构化角色感知策略优化(SRPO),通过角色感知的token级信用分配提升多模态推理中的证据基础推理能力,无需外部奖励模型。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06708 2026-05-11 cs.CV cs.AI 62%

Visual Text Compression as Measure Transport

视觉文本压缩作为度量传输

Lv Tang, Tianyi Zheng, Yang Liu, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过度量传输理论分析视觉文本压缩,提出无标签路由准则和传输感知聚焦机制,提升压缩效率并优化下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03728 2026-05-11 cs.CV cs.AI 62%

CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval

CSMCIR: 基于记忆库的增强对称对齐用于复合图像检索

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun

机构 * Kuaishou Technology(快播科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CSMCIR,通过多级链式思维提示策略、对称双塔架构和熵基记忆库策略,实现高效查询-目标对齐,提升复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07562 2026-05-11 cs.CV 57%

Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs

超越GSD-as-Token:远程 sensing VLMs 的连续尺度调节

Song Zhang, Yanlong Chen, Yilin Li, Yining Chen, Zili Yi, Xiaowei Zhang, Yawei Li

机构 * Nanjing University(南京大学) ETH Zurich(苏黎世联邦理工学院) RWTH Aachen University(亚琛工业大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ScaleEarth框架,通过连续尺度条件变量动态调节模型计算路径,结合SSE-U和GeoScale-VQA实现遥感VLMs在不同GSD下的高效适应。

Comments Under review. 30 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07517 2026-05-11 cs.IR cs.AI 57%

LARAG: Link-Aware Retrieval Strategy for RAG Systems in Hyperlinked Technical Documentation

LARAG:超链接技术文档中基于链接的RAG系统检索策略

Giorgia Bolognesi, Claudio Estatico, Ulderico Fugacci, Isabella Mastroianni, Claudio Muselli, Luca Oneto

机构 * Rulex s.r.l.(Rulex公司) Department of Mathematics (DIMA), University of Genoa(热那亚大学数学系) Department of Computer Science, Bioengineering, Robotics, and Systems Engineering (DIBRIS), University of Genoa(热那亚大学计算机科学、生物工程、机器人学和系统工程系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 LARAG通过利用HTML文档中已有的超链接结构,改进RAG系统检索效果,提升答案质量并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06943 2026-05-11 cs.LG 57%

ProtoSSL: Interpretable Prototype Learning from Unlabeled Time-Series Data

ProtoSSL: 从未标记时间序列数据中学习可解释的原型

Steven Song, Sahil Sethi, Brett Beaulieu-Jones, Robert L. Grossman

机构 * Department of Computer Science(计算机科学系) Center for Translational Data Science(转化数据科学中心) Medical Scientist Training Program(医学科学家培训计划) Pritzker School of Medicine(皮尔兹克医学院) Center for Computational Medicine & Clinical AI(计算医学与临床人工智能中心) Section of Biomedical Data Science, Department of Medicine(医学部生物医学数据科学部门)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 ProtoSSL通过自监督学习从未标记时间序列数据中学习可解释的原型,提升低数据场景下的性能,并在人类评估中表现更优,扩展至音频分类。

详情

展开后加载摘要…

URL PDF HTML 收藏