arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 275 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 275 篇

2607.13661 2026-08-12 cs.CV 版本更新 57%

Fine-grained CLIP fine-tuning with self-annotated region alignment

基于自标注区域对齐的细粒度CLIP微调

Chenyang Zhao, Wei Lin, Janet H. Hsiao, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Hong Kong University of Science & Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对CLIP在细粒度表示上的局限,提出SFF-CLIP方法,仅用图像-文本对输入,通过运行时区域-短语对齐方案提升其细粒度表示能力,在相关任务中性能显著提升且维持原CLIP图像级任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21944 2026-08-12 cs.LG 版本更新 57%

Clarity: The Flexibility-Interpretability Trade-Off in Sparsity-aware Concept Bottleneck Models

Clarity:稀疏性感知概念瓶颈模型中的灵活性与可解释性权衡

Konstantinos P. Panousis, Diego Marcos

机构 * Department of Statistics, University of Economics and Business(经济与商业大学统计系) UMR TETIS, Inria, EVERGREEN, University of Montpellier(蒙彼利埃大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 研究探讨了概念瓶颈模型中稀疏性对语义对齐的影响,提出Clarity指标衡量下游性能与概念激活稀疏性和精度的相互作用,通过实验揭示灵活性与可解释性之间的关键权衡。

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06939 2026-08-11 cs.CV 版本更新 57%

Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal

面向恶劣天气去除的退化感知跨模态补偿提示学习

Wanshu Fan, Yunzhe Zhang, Yue Shen, Liyan Wang, Jing Qin, Kin-Man Lam, Cong Wang, Jinshan Pan

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) The Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加利福尼亚大学旧金山分校) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对恶劣天气导致图像退化影响视觉系统可靠性的问题,提出 DCMPC-Net 模型,通过跨模态提示补偿实现鲁棒的恶劣天气图像修复,性能优于现有最先进方法。

Comments Accepted for publication in IEEE Transactions on Image Processing. The code is available at: https://github.com/fanamber831/DCMPC-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 57%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27581 2026-08-10 cs.LG 版本更新 57%

MUGEN: A Unified Framework for Efficient Motion Understanding and Generation

MUGEN:用于高效运动理解与生成的统一框架

Zhankai Ye, Yukai Jin, Bingyang Wei, Bofan Li, Yusen Wu, Fangyi Li, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Christian University(得克萨斯基督教大学) University of Miami(迈阿密大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 57%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18816 2026-08-10 cs.CV 版本更新 57%

Grad-ECLIP: Gradient-based Visual and Textual Explanations for CLIP

Grad-ECLIP: 基于梯度的CLIP视觉与文本解释

Chenyang Zhao, Kun Wang, Janet H. Hsiao, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Division of Social Science and Department of Computer Science & Engineering, Hong Kong University of Science & Technology(香港科学与技术大学社会科学学院及计算机科学与工程系) SenseTime Group Ltd(时光集团有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Grad-ECLIP方法,通过分解CLIP编码器架构并分析匹配相似度与中间空间特征的关系,生成有效热图以解释CLIP匹配结果。通过通道和空间权重提升视觉解释质量,并通过定性定量评估验证其有效性。

Journal ref Zhao C, Wang K, Hsiao J H, et al. Grad-eclip: Gradient-based visual and textual explanations for clip[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04586 2026-08-07 cs.CL cs.AI 版本更新 57%

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

通过资源感知型语音编码器混合模型打破多对多语音到文本翻译中的多语言性诅咒

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Chengpeng Fu, Yu Wang, Ming Liu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多对多语音到文本翻译中的多语言性诅咒问题,提出资源感知型MoSE框架与五阶段课程学习策略,其4B参数模型在45种语言的全方向翻译任务上实现最优性能,显著提升低资源语言表现且不损害高资源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23265 2026-08-04 cs.CV 版本更新 57%

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

WaveZip:用于视频令牌压缩的小波驱动时空解耦

Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, jiebo Luo

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 57%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18819 2026-08-04 cs.CV 版本更新 57%

Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

用于3D理解的参数高效CLIP适配:通过统一分词实现

Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) University of Pisa(比萨大学) Beijing Forestry University(北京林业大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (GZ)(香港科技大学) Shandong University(山东大学) University of California, Merced(加州大学默塞德分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出参数高效框架UTok3D,通过学习尺度归一化3D分词器,实现冻结CLIP视觉主干在无标注情况下对不同尺度点云的复用,完成3D分割任务。

Comments 14 pages, tokenizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13415 2026-08-03 cs.CV 版本更新 57%

Distance-aware Soft Prompt Guidance for Multimodal Valence-Arousal Estimation

面向距离的软提示学习用于多模态愉悦-唤醒估计

Byeongjin Jung, Chanyeong Park, Sejoon Lim

机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) Department of Automobile and IT Convergence(汽车与IT融合系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。

Comments 8pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13657 2026-07-31 cs.LG 版本更新 57%

Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation

密集监督,稀疏更新:论策略蒸馏的稀疏性与几何结构

Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文分析策略蒸馏(OPD)中参数更新的稀疏性和几何特性,发现更新稀疏且集中于小权重坐标,并验证了稀疏子网络的有效性。

Comments Code is available at https://github.com/SydCS/OPD-Param-Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18988 2026-07-28 cs.CV 版本更新 57%

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

DobicVLM:通过群体相对策略优化使胸部X光报告生成与临床基础的程序化奖励保持一致

Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chibundu, Christian Maurice, Mary Donald Essien, Oluwaseun Odunsi, Oluwasegun Oguntuase, Abiodun Adereni

机构 * Dobic Health(多比克健康公司) University of Ibadan(伊巴丹大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对自动胸部X光报告生成难题,提出DobicVLM模型,结合监督微调、GRPO及临床奖励,用可解释规则组件执行标准,经训练和评估,该模型多数标准优于Gemini 2.5 Flash,证明GRPO在资源受限设置中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17820 2026-07-23 cs.CV 版本更新 57%

PRiSM: Prototype Regularization for Few-Shot VLMs

PRiSM:少样本视觉语言模型的原型正则化

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montreal(蒙特利尔高等商学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20575 2026-07-21 cs.CV 版本更新 57%

An interactive enhanced driving dataset for autonomous driving

一种交互增强的自动驾驶数据集

Haojie Feng, Xinrui Zhang, Mengjie Tian, Peizhi Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Junfan Zhu, Jianzhou Wang, Dongxiao Yin, Lu Xiong

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。

Comments Accepted for publication in Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15095 2026-07-20 cs.CL cs.AI cs.MA 版本更新 57%

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents

数字万神殿:使用大语言模型智能体模拟和审计联盟形成

Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel

机构 * Ghent University(根特大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。

Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19244 2026-07-17 cs.CV 版本更新 57%

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新 57%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26738 2026-07-16 cs.CV 版本更新 57%

Do Image Editing Models Understand Lighting?

图像编辑模型是否理解光照?

Tim Küchler, Johann-Friedrich Feiden, Matthias Nießner, Carsten Rother

机构 * Heidelberg University(海德堡大学) Technical University of Munich(慕尼黑工业大学) Zuse School ELIZA

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.CV

AI总结 提出3D锚定光探针基准(3DLP),通过真实世界HDR数据集评估图像编辑模型对光照变化的编辑准确性,发现模型在镜面高光区域表现较好,但整体仍有改进空间。

Comments Project page: https://tim-kuechler.github.io/3DLP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24787 2026-07-15 cs.AI 版本更新 57%

ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing

ReLope:KL正则化的LoRA探针用于多模态大语言模型路由

Yaopei Zeng, Congchao Wang, Blake JianHang Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊AGI) Google(谷歌)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.AI

AI总结 针对多模态大语言模型路由中探针性能下降问题,提出Attention Probe和KL正则化的LoRA探针ReLope,通过改进隐藏状态质量提升路由效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15868 2026-07-14 cs.CV 版本更新 57%

SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval

SOLAR:用于对称多模态检索的自监督联合学习

Wenjie Yang, Hang Yu, Yuyu Guo, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出SOLAR框架,通过自监督学习解决对称多模态检索问题,利用未标记数据提升模型性能,实验显示其在基准测试中优于现有方法。

Comments Accepted by ICML 2026. Code, model and benchmark are available at https://github.com/codefuse-ai/SOLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21309 2026-07-13 cs.CV 版本更新 57%

Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos

基于缓存个性化的时间测试适应用于视频面部表情识别

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔工程学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与信息工程系,蒙特利尔工程学院,加拿大)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TTA-CaP方法,通过缓存实现高效视频面部表情识别的模型个性化,减少计算开销并提升跨主体和环境变化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27742 2026-07-09 cs.CV 版本更新 57%

TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

TIR-Agent:训练一个探索性且高效的图像修复代理

Guoli Jia, Yisheng Zhang, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou

机构 * Tsinghua University(清华大学) China Unicom(中国联通) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18603 2026-07-07 cs.CV 版本更新 57%

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知

Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Technology University of Waterloo(滑铁卢大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 57%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03553 2026-07-07 cs.AI cs.CL cs.DL 版本更新 57%

Chronos: The AI Co-Historian

迈向AI历史学家:从原始资料中进行代理信息提取

Lorenz Hufe, Niclas Griesshaber, Gavin Greif, Sebastian Oliver Eck, Philip Torr

机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) Faculty of Music, University of Oxford(牛津大学音乐学院) Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI

AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 57%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 57%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新 57%

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏