arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-07 至 2026-07-07 共收录 176 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 41 篇

2509.15061 2026-07-07 cs.RO cs.CV 版本更新 70%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15330 2026-07-07 cs.CV 版本更新 70%

CoDoL: Conditional Domain Prompt Learning for Out-of-Distribution Generalization

CoDoL:用于分布外泛化的条件域提示学习

Min Zhang, Yuyin Wang, Zhongxiang Dai, Zhikang Chen, Jie Zhou, Miao Liu, Sen Cui

机构 * East China Normal University(东华师范大学) Xidian University(西安电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对基于提示的CLIP方法存在的文本描述不准确、视觉语言嵌入对齐有限问题,提出CoDoL方法,利用域信息形成提示,还提出DMN生成输入条件令牌,实验验证其在分布外泛化的有效性。

Comments Accepted to TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交 62%

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03738 2026-07-07 cs.CV cs.AI 新提交 62%

Attending to Multimodal Generation One Token at a Time

一次关注一个令牌的多模态生成

Varun Gupta, Vineet Gandhi, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad(海得拉巴国际信息技术研究所计算机视觉与信息处理中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型生成时令牌级动态,按语义角色跟踪注意力转移。引入多模态任务,通过因果注意力阻断干预等方法,发现一致模式并据此提出测试时干预,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10840 2026-07-07 cs.LG cs.AI q-bio.QM 版本更新 62%

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Ali, Chengkun Yang, Alasdair Edward Gent, Victor Moas, Rishikesan Kamaleswaran

机构 * Duke University(杜克大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。

Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 62%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07406 2026-07-07 cs.LG cs.AI 版本更新 62%

InverseScope: Scalable Activation Inversion for Interpreting Large Language Models

InverseScope:用于解释大语言模型的可扩展激活反演

Yifan Luo, Zhennan Zhou, Bin Dong

机构 * School of Mathematical Science, Peking University(北京大学数学科学学院) School of Science, Westlake University(西湖大学理学院) Beijing International Center for Mathematical Research(北京国际数学研究中心) New Cornerstone Science Laboratory, Peking University(北京大学新基石科学实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型内部表征解释难题,提出InverseScope框架,通过输入反演解释神经激活,用新颖架构提高采样效率,揭示模型表征空间结构,可扩展到14B参数模型并推广到分布外输入。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04011 2026-07-07 cs.CL cs.AI 新提交 57%

Separating Representation from Reconstruction Enables Scalable Text Encoders

将表示与重建分离可实现可扩展的文本编码器

Megi Dervishi, Mathurin Videau, Yann LeCun

机构 * FAIR Meta New York University(纽约大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 研究发现自BERT以来编码器变化小,通过冻结主干评估揭示问题源于其扁平设计。提出CrossBERT架构分离高质量编码表示学习与令牌重建,能提高掩码率和梯度收集效率,在相关基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12471 2026-07-07 stat.ML cs.CL cs.ET cs.LG 新提交 57%

Identifiability Without Gaussianity: Symbolic World Models and Near-Infinite Temporal Consistency

无高斯假设的可识别性:符号世界模型与近无限时间一致性

Seth Dobrin, Łukasz Chmiel

机构 * Department of Computer Science, Stanford University(1 计算机科学系,斯坦福大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出物理基础符号架构(PGSA),证明其在非高斯动态系统中实现精确线性可识别性和近无限时间一致性,克服了统计世界模型的高斯边界限制。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18603 2026-07-07 cs.CV 版本更新 57%

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知

Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Technology University of Waterloo(滑铁卢大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 57%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03553 2026-07-07 cs.AI cs.CL cs.DL 版本更新 57%

Chronos: The AI Co-Historian

迈向AI历史学家:从原始资料中进行代理信息提取

Lorenz Hufe, Niclas Griesshaber, Gavin Greif, Sebastian Oliver Eck, Philip Torr

机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) Faculty of Music, University of Oxford(牛津大学音乐学院) Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI

AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 57%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 57%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新 57%

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12096 2026-07-07 cs.MM cs.CV cs.IT eess.SP math.IT 版本更新 57%

Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications

令牌通信:一种用于跨模态上下文感知语义通信的大模型驱动框架

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Rahim Tafazolli, Mehdi Bennis, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing 100081, China(信息与电子学院,北京理工大学,北京) GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey, Guildford, United Kingdom(5GIC与6GIC,通信系统研究所(ICS), Surrey大学, Guildford,英国) Centre for Wireless Communications, University of Oulu, 90014 Oulu, Finland(无线通信中心,奥卢大学, Oulu,芬兰) School of Computer Science and Engineering, Nanyang Technological University, Singapore 639798(计算机科学与工程学院,南洋理工大学, Singapore)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 介绍令牌通信框架,借助生成基础模型和多模态大语言模型,以令牌为通信单元,在语义通信中利用跨模态上下文信息,提升带宽效率,并给出关键原则与研究方向。

Comments Accepted at IEEE Wireless Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02590 2026-07-07 cs.SE 新提交 50%

OmniPresent: Generating Coherent Presentation Suites from Scientific Papers

OmniPresent:从科学论文生成连贯的演示文稿套件

Qianli Ma, Jipeng Xiao, Siyu Wang, Zhiheng Tian, Wangyu Feng, Shibo Wang, Chang Guo, Shuochen Chang, Qingyang Liu, Zhipeng Zhang

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 9 篇

2607.02897 2026-07-07 cs.CR cs.AI cs.CV 新提交 91%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 其他VLM :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments 17 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03657 2026-07-07 cs.CV cs.AI 新提交 90%

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 其他VLM :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23102 2026-07-07 eess.IV cs.CV 版本更新 79%

Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation

区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成

Sunggu Kyung, Jinyoung Seo, Hyunseok Lim, Dongyeong Kim, Hyungbin Park, Jimin Sung, Jihyun Kim, Wooyoung Jo, Yoojin Nam, Namkug Kim

机构 * Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系) University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院) Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出MedRegion-CT框架,通过区域慢快标记器联合建模全局与细粒度信息、伪掩码引导关注诊断关键区域、结构化病变信息提示,实现高质量CT报告生成,在多项指标上达到最优。

Comments Accepted to ECCV 2026. 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新 70%

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03900 2026-07-07 cs.CV cs.LG 新提交 62%

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

USE:一种用于测试时提示调整的统一自集成框架

Siru Jiang, Jian Liang, Ran He, Tieniu Tan

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) Nanjing University(南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 57%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07155 2026-07-07 cs.CV 57%

CHIMERA: Adaptive Cache Injection and Semantic Anchor Prompting for Zero-shot Image Morphing with Morphing-oriented Metrics

CHIMERA:适应性缓存注入与语义锚点提示的零样本图像变形方法:基于变形导向的度量

Dahyeon Kye, Jeahun Sung, Minkyu Jeon, Jihyong Oh

机构 * Chung-Ang University(Chung-Ang 大学) Princeton University(普林斯顿大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 CHIMERA通过逆向引导去噪和互补特征重用,解决传统图像变形方法中特征重用不充分和文本条件不兼容的问题,提出语义锚点提示和变形导向度量,提升变形效果的平滑性和语义一致性。

Comments ECCV 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/CHIMERA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15829 2026-07-07 cs.CV 版本更新 57%

Towards Realistic Remote Sensing Dataset Distillation with Discriminative Prototype-guided Diffusion

基于判别原型引导扩散的逼真遥感数据集蒸馏研究

Yonghao Xu, Pedram Ghamisi, Qihao Weng

机构 * Computer Vision and Learning Systems, Department of Electrical Engineering, Linköping University(计算机视觉与学习系统,电气工程系,利厄普大学) Helmholtz-Zentrum Dresden-Rossendorf, Responsible AI Group(海姆霍尔茨·德累斯顿-罗斯托克研究中心,负责任人工智能小组) University of Iceland, Faculty of Electrical and Computer Engineering(冰岛大学,电气与计算机工程学院)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 针对遥感图像解释依赖大量训练数据带来的高成本问题,提出判别原型引导扩散框架,通过提取原型、构建语义锚及筛选候选样本,将大规模数据集浓缩成有代表性的蒸馏数据集用于下游模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04630 2026-07-07 cs.SE 版本更新 50%

Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead

网络物理系统软件工程的基础模型:未来之路

Chengjie Lu, Pablo Valle, Jiahui Wu, Erblin Isaku, Hassan Sartaj, Aitor Arrieta, Shaukat Ali

专题命中 其他VLM :vision-language model(abstract)

AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。

Comments 3 figures, 20 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏