arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2604.21082 2026-04-24 cs.CL cs.LG 57%

Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting

权重什么重要:通过标记重加权提升医学报告生成的样本效率

Alexander Weers, Daniel Rueckert, Martin J. Menten

机构 * TUM School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文通过标记重加权方法提升医学报告生成的样本效率,实验表明在眼科报告生成中,该方法在较少训练数据下也能获得高质量报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20854 2026-04-24 cs.IR cs.AI 57%

ERA: Evidence-based Reliability Alignment for Honest Retrieval-Augmented Generation

ERA:基于证据的可靠性对齐用于诚实检索增强生成

Sunguk Shin, Meeyoung Cha, Byung-Jun Lee, Sungwon Park

机构 * Korea University(韩国大学) Gauss Labs Inc.(Gauss实验室)

专题命中 VLM训练与架构 :grounding(abstract_cn);分类 cs.AI

AI总结 本文提出ERA框架,通过将置信度估计从标量概率转为显式证据分布,提升RAG系统中的回避行为,有效区分知识冲突与不确定性,实验表明在标准基准和定制泛化数据集上表现优异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20429 2026-04-23 cs.CV 57%

Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

快速-精细:一种用于遥感跨模态检索的两阶段框架,具有多粒度表示

Xi Chen, Xu Chen, Xiangyang Jia, Xu Zhang, Shuquan Wei, Wei Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种两阶段框架,通过多粒度表示提升遥感跨模态检索效率与精度,采用文本无关召回和文本引导重排序阶段,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 57%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV 57%

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03740 2026-04-23 cs.CV cs.CL 57%

CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values

CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系) Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIP-SVD通过奇异值微调方法,以0.04%的参数量实现高效视觉-语言模型适应,提升适应性能并保留泛化能力,在11个自然和10个生物医学数据集上取得最佳分类结果。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18452 2026-04-21 cs.CV cs.CL 57%

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

ESsEN: 在低资源环境下训练紧凑的判别视觉-语言变换器

Clayton Fields, Casey Kennington

机构 * Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ESsEN模型,通过双塔编码器结构和传统卷积网络,实现低资源环境下高效视觉-语言模型训练,实验表明其参数量仅为其他模型的分数,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 57%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 57%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV 57%

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17629 2026-04-21 cs.CV 57%

BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs

BioVLM:通过路由提示而非参数实现生物医学VLMs的跨模态泛化

Mainak Singha, Tanisha Gupta, Ankit Jha, Muhammad Haris Khan, Sayantani Ghosh, Biplab Banerjee

机构 * University of Trento(特伦托大学) Carnegie Mellon University(卡内基梅隆大学) LNMIIT Jaipur(贾伊普尔 LNMIIT) MBZUAI Sunandan Divatia School of Science(Sunandan Divatia 科学学院) IIT Bombay(博伊斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 BioVLM通过动态提示选择和提示银行学习,提升跨域泛化能力,无需大量骨干网络微调,在11个MedMNIST+2D数据集上取得新突破。

Comments Accepted in ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07892 2026-04-21 cs.CL cs.AI 57%

Data Selection for Multi-turn Dialogue Instruction Tuning

多轮对话指令微调的数据选择

Bo Li, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) PKU-CMCC(Hubei) Joint Research Lab for LLM Industrial Applications(北京大学-湖北CMCC大模型工业应用联合实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出MDS框架,通过全局覆盖和局部结构阶段选择多轮对话数据,提升指令微调效果,优于现有方法并在多个基准测试中表现最佳。

Comments Github: https://github.com/WisdomShell/MDS Project: https://wisdomshell.github.io/MDS/

Journal ref Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13061 2026-04-20 cs.CL cs.AI 57%

Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction

令牌统计揭示多轮LLM交互中的对话漂移

Wael Hafez, Amir Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 研究通过令牌频率统计监测对话一致性,提出Bipredictability指标,验证其在多轮交互中的有效性,显示结构监控可补充语义评估。

Comments 13 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20210 2026-04-20 cs.CL cs.AI 57%

CRoCoDiL: Continuous and Robust Conditioned Diffusion for Language

CRoCoDiL:连续且稳健的语言条件扩散

Roy Uziel, Omer Belhasin, Itay Levy, Akhiad Bercovich, Ran El-Yaniv, Ran Zilberstein, Michael Elad

机构 * NVIDIA

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出CRoCoDiL,通过连续语义空间改进扩散模型,实现更高质量和更快的文本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15090 2026-04-17 cs.CV 57%

Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID

超越视觉线索:基于语义的标记过滤和专家路由用于即时人物重识别

Jiaxuan Li, Xin Wen, Zhihang Li

机构 * Tsinghua University(清华大学) Independent Researcher(独立研究者) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出STFER框架,利用大视觉-语言模型生成身份一致的文本,提升对服装变化和模态转换的鲁棒性,通过语义驱动的标记过滤和专家路由实现多场景鲁棒性,实验表明模型在AT-USTC数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13970 2026-04-16 cs.CV 57%

MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images

MApLe:多实例诊断报告与大医学图像的对齐

Felicia Bader, Philipp Seeböck, Anastasia Bartashova, Ulrike Attenberger, Georg Langs

机构 * Computational Imaging Research Lab, Department of Biomedical Imaging and Image-guided Therapy, Medical University of Vienna(计算成像研究实验室,生物医学成像与影像引导治疗系,维也纳医学大学) Comprehensive Center for Artificial Intelligence in Medicine, Medical University of Vienna(医学人工智能综合中心,维也纳医学大学) Medical Anomaly Detection (MANO) Group, Computational Imaging Research (CIR), Department of Biomedical Imaging and Image-guided Therapy, Medical University of Vienna(医学异常检测(MANO)组,计算成像研究(CIR),生物医学成像与影像引导治疗系,维也纳医学大学) Department of Biomedical Imaging and Image-Guided Therapy, Medical University of Vienna(生物医学成像与影像引导治疗系,维也纳医学大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 MApLe通过多任务多实例对齐方法,解决诊断报告与图像局部区域的关联问题,提升医学图像与文本的对齐性能。

Comments Accepted for MIDL 2026; Reviews available at https://openreview.net/forum?id=M8OO3CRbL9#discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13073 2026-04-16 cs.CL cs.AI cs.MM 57%

OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs

OmniTrace:面向多模态大语言模型生成过程的统一归因框架

Qianqi Yan, Yichen Guo, Ching-Chen Kuo, Shan Jiang, Hang Yin, Yang Zhao, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) eBay

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 OmniTrace提出一种轻量级框架,通过生成过程追踪实现多模态大语言模型的统一归因,提供跨模态解释并提升解释的稳定性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14234 2026-04-16 cs.CV 57%

ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

ViBES:一个具有行为智能的3D虚拟身体对话代理

Juze Zhang, Changan Chen, Xin Chen, Heng Yu, Tiange Xiang, Ali Sartaz Khan, Shrinidhi K. Lakshmikanth, Ehsan Adeli

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 ViBES通过联合规划语言和运动,实现对话条件下的身体动作生成,提升了多轮对话中的社会交互能力。

Comments Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 57%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 57%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 57%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11751 2026-04-14 cs.RO cs.AI 57%

Grounded World Model for Semantically Generalizable Planning

基于语义泛化的世界模型用于规划

Quanyi Li, Lan Feng, Haonan Zhang, Wuyang Li, Letian Wang, Alexandre Alahi, Harold Soh

机构 * Independent(独立) EPFL(瑞士联邦理工学院洛桑) Beihang University(北京航空航天大学) University of Toronto(多伦多大学) NUS(新加坡国立大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11337 2026-04-14 cs.MA cs.AI cs.CY 57%

Governance by Design: A Parsonian Institutional Architecture for Internet-Wide Agent Societies

设计治理:一种帕森斯制度架构用于互联网范围的智能体社会

Anbang Ruan

机构 * NetX Foundation(NetX 基金会)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于帕森斯AGIL框架的制度架构,用于治理互联网范围的智能体社会,发现现有生态系统缺乏协调层和规范基础,提出治理基础设施的优先路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12748 2026-04-14 cs.AI cs.HC cs.SE 57%

X-SYS: A Reference Architecture for Interactive Explanation Systems

X-SYS:交互解释系统的参考架构

Tobias Labarta, Nhi Hoang, Maximilian Dreyer, Jim Berend, Oleg Hein, Jackie Ma, Wojciech Samek, Sebastian Lapuschkin

机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究所) Technical University Dublin(都柏林理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出X-SYS参考架构,通过STAR质量属性和五组件分解,指导交互解释系统的设计与实现,解决可解释AI在系统部署中的挑战。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV 57%

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07765 2026-04-14 cs.CV 57%

RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs

RemoteAgent: 通过基于强化学习的代理多模态大语言模型弥合模糊人类意图与遥感观测之间的鸿沟

Liang Yao, Shengxiang Xu, Fan Liu, Chuanyi Zhang, Bishun Yao, Rui Min, Yongjun Li, Chaoqian Ouyang, Shimin Di, Min-Ling Zhang

机构 * Hohai University(河海大学) Southeast University(东南大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文提出RemoteAgent框架,通过VagueEO数据集和强化学习微调,使多模态大语言模型能直接解决图像和稀疏区域任务,并通过模型上下文协议智能协调专用工具进行密集预测,提升遥感任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20725 2026-04-14 cs.CV 57%

Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中

Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Duxiaoman(度小满)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05564 2026-04-14 cs.CV 57%

ProPhy: Progressive Physical Alignment for Dynamic World Simulation

ProPhy:渐进式物理对齐用于动态世界模拟

Zijun Wang, Panwen Hu, Jing Wang, Terry Jingchen Zhang, Yuhao Cheng, Long Chen, Yiqiang Yan, Zutao Jiang, Hanhui Li, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ETH Zürich(苏黎世联邦理工学院) Lenovo Research(联想研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 ProPhy通过渐进式物理对齐框架,实现物理感知的视频生成,提升动态物理现象的准确性与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏