arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-05 至 2026-03-05 共收录 66 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2603.03343 2026-03-05 q-bio.NC cs.AI cs.LG 62%

Neuro-Symbolic Decoding of Neural Activity

神经符号解码神经活动

Yanchen Wang, Joy Hsu, Ehsan Adeli, Jiajun Wu

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NEURONA通过结合符号推理与fMRI基础,提升神经活动解码的准确性和泛化能力。

Comments ICLR 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 57%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 57%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01222 2026-03-05 cs.CL cs.AI 57%

WebDS: An End-to-End Benchmark for Web-based Data Science

WebDS: 一种端到端的基于网络的数据科学基准

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexander Spangher, Shikhar Murty, Tenghao Huang, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Pinetree Research(Pinetree研究公司) University of California, Berkeley(加州大学伯克利分校) Singapore University of Technology and Design(新加坡科技设计大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 WebDS提出了一种端到端的基于网络的数据科学基准,旨在评估代理在复杂多步骤任务中的表现,揭示当前LLM在实际数据科学任务中的性能差距。

Comments 14 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06912 2026-03-05 cs.RO cs.AI 57%

A Bayesian Framework for Active Tactile Object Recognition, Pose Estimation and Shape Transfer Learning

基于贝叶斯框架的主动触觉物体识别、姿态估计与形状迁移学习

Haodong Zheng, Andrei Jalba, Raymond H. Cuijpers, Wijnand IJsselsteijn, Sanne Schoenmakers

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于贝叶斯框架的主动触觉系统,结合定制粒子滤波器与高斯过程隐面,实现物体识别、姿态估计与形状迁移学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04107 2026-03-05 physics.ins-det hep-ex 50%

The CMS ME0 Upgrade: Enhancing Forward Muon Reconstruction at the HL-LHC

CMS ME0升级:提升HL-LHC前方缪子重建

Anureet Kaur

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CMS ME0升级通过六层站扩展伪横坐标覆盖范围,提升HL-LHC前方缪子重建的灵敏度和精度。

Comments 5 pages, 6 figures, Proceedings of the 31st International Symposium on Lepton Photon Interactions at High Energies (LP2025). https://cds.cern.ch/record/2952677

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11291 2026-03-05 cs.RO 50%

H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model

H-WM:由分层世界模型引导的机器人任务和运动规划

Jinbang Huang, Wenyuan Chen, Zhiyuan Li, Oscar Pang, Xiao Hu, Lingfeng Zhang, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Tongtong Cao, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2603.03302 2026-03-05 cs.CL cs.AI cs.IR 57%

Developing an AI Assistant for Knowledge Management and Workforce Training in State DOTs

为州交通部门的知识管理和员工培训开发人工智能助手

Divija Amaram, Lu Gao, Gowtham Reddy Gudla, Tejaswini Sanjay Katale

机构 * Department of Computer Science, University of Houston(计算机科学系,休斯顿大学) Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Ph.D Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Engineering Data Science, University of Houston(工程数据科学,休斯顿大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种多代理架构的RAG框架,用于州交通部门的知识管理和决策支持,通过整合文档检索与大语言模型生成,提升信息检索与响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 6 篇

2504.08714 2026-03-05 cs.CV cs.CL cs.LG 73%

Generating Fine Details of Entity Interactions

生成实体交互的细节

Xinyi Gu, Jiayuan Mao

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种基于多模态大语言模型的方法,通过分解和细化过程提升图像中实体交互细节的生成质量。

Comments EMNLP 2025. Project Page: https://detailscribe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22235 2026-03-05 cs.AI 70%

Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化

Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出CES多代理框架,通过训练高阶调度器解决GUI代理在长周期任务中的责任耦合和状态管理问题,提升任务规划与执行效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19655 2026-03-05 cs.RO 67%

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI 62%

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04244 2026-03-05 cs.SE cs.AI cs.HC 57%

FeedAIde: Guiding App Users to Submit Rich Feedback Reports by Asking Context-Aware Follow-Up Questions

FeedAIde: 通过提问情境感知的后续问题引导应用用户提交丰富的反馈报告

Ali Ebrahimi Pourasad, Meyssam Saghiri, Walid Maalej

机构 * University of Hamburg(汉堡大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 FeedAIde通过情境感知和生成式AI技术,帮助用户更高效地提交详细反馈报告,提升开发人员获取信息的价值。

Comments Accepted for publication at the 13th International Conference on Mobile Software Engineering and Systems (MOBILESoft) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17034 2026-03-05 cs.RO cs.NE 50%

Evolution 6.0: Robot Evolution through Generative Design

进化6.0:通过生成设计实现机器人进化

Muhammad Haris Khan, Artyom Myshlyaev, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 进化6.0通过生成式AI实现机器人自主设计工具和执行任务,展示高成功率和泛化能力。

Comments Accepted to HRI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 9 篇

2602.22227 2026-03-05 cs.LG cs.AI 84%

Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models

动态对抗强化学习用于鲁棒多模态大语言模型

Yicheng Bao, Xuhong Wang, Qiaosheng Zhang, Chaochao Lu, Xia Hu, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AOT方法,通过对抗训练提升多模态大语言模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03527 2026-03-05 cs.LG 83%

Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis

视觉-语言模型在病理图像分析中的logit级不确定性量化

Betul Yurdem, Ferhat Ozgur Catak, Murat Kuzlu, Mehmet Kemal Gullu

机构 * Department of Electrical and Electronics Engineering, Izmir Bakircay University(电气与电子工程系,伊兹密尔巴克伊大学) Department of Electrical Engineering and Computer Science, University of Stavanger(电气工程与计算机科学系,斯塔万格大学) Batten College of Engineering and Technology, Old Dominion University(工程与技术学院,老奥布良大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.LG

AI总结 本研究提出了一种基于VLMs的logit级不确定性量化框架,用于评估病理图像分析中模型的可靠性与安全性。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 79%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04325 2026-03-05 cs.CV cs.LG 73%

Scalable Evaluation of the Realism of Synthetic Environmental Augmentations in Images

可扩展性评估合成环境增强图像的真实性

Damian J. Ruck, Paul Vautravers, Oliver Chalkley, Jake Thomas

机构 * Advai Ltd(Advai有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种可扩展框架,用于评估合成环境增强图像的真实性,发现生成式AI在大多数条件下优于基于规则的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03768 2026-03-05 cs.RO cs.AI 70%

Cognition to Control - Multi-Agent Learning for Human-Humanoid Collaborative Transport

认知到控制 - 多智能体学习用于人-仿人协作运输

Hao Zhang, Ding Zhao, H. Eric Tseng

机构 * Department of Electrical Engineering, the University of Texas at Arlington(电气工程系,德克萨斯大学阿灵顿分校) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 本研究提出认知到控制框架,通过多智能体强化学习实现人-仿人协作运输中的持续推理与稳定控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 62%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 幻觉与鲁棒性 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03637 2026-03-05 cs.CV cs.AI cs.CR 62%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17110 2026-03-05 cs.CV cs.LG 62%

Beyond Accuracy: What Matters in Designing Well-Behaved Image Classification Models?

超越准确率:设计良好行为图像分类模型所关注的问题

Robin Hesse, Doğukan Bağcı, Bernt Schiele, Simone Schaub-Meyer, Stefan Roth

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了图像分类模型在鲁棒性、校准和公平性等质量维度上的表现,提出QUBA指标以评估和推荐模型。

Comments Published in TMLR (01/2026) | OpenReview: https://openreview.net/forum?id=E7HDtLCoT6 | Project page: https://visinf.github.io/beyond-accuracy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 57%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 12 篇

2602.22469 2026-03-05 cs.CV cs.AI 86%

Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models

超越主导块:面向 grounded 视觉-语言模型的空间信用再分配

Niamul Hassan Samin, Md Arifur Rahman, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin, Md Ashikur Rahman

机构 * The KOW Company(KOW公司) American International University Bangladesh (AIUB)(美国国际大学(Bangladesh)) University of Dhaka(达卡大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCR方法,通过空间信用再分配减少视觉-语言模型的幻觉问题,提升生成质量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06415 2026-03-05 cs.CV cs.AI cs.CL 84%

Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models

保持索引的轻量级标记修剪用于视觉-语言模型中的高效文档理解

Jaemin Son, Sujin Choi, Inyong Yun

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级标记修剪方法,通过过滤非信息性背景区域来降低视觉-语言模型在文档理解任务中的计算成本,同时保持较高的准确性。

Comments Accepted to ICLR 2026 Workshop MM Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18349 2026-03-05 cs.CV 83%

Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy

通过自动设计的VLM引导运动策略实现人-物交互

Zekai Deng, Ye Shi, Kaiyang Ji, Lan Xu, Shaoli Huang, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) AgiBot

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于VLMs的统一物理框架,通过自动设计的RMD方法实现人-物交互合成,提升了运动生成的自然性和通用性。

Comments iclr camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20704 2026-03-05 cs.CL cs.AI cs.CR 79%

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas

机构 * Advai

专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.AI

AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。

Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript

Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03681 2026-03-05 cs.CV cs.AI 73%

EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs

EvoPrune:面向高效MLLMs的早期阶段视觉标记剪枝

Yuhao Chen, Bin Shan, Xin Ye, Cheng Chen

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 EvoPrune通过在视觉编码早期阶段剪枝视觉标记,提升多模态大语言模型的推理效率,实现在VideoMME数据集上2倍加速且性能损失低于1%。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI 73%

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 70%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏