arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2606.15920 2026-07-10 cs.CV 新提交 57%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07521 2026-07-09 cs.HC cs.AI 新提交 57%

Creativity from Friction: Human-AI Interaction for Exploratory Structural Design

摩擦产生创造力:用于探索性结构设计的人机交互

Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady

机构 * Block Research Group, Department of Architecture, ETH Zurich(建筑系,苏黎世联邦理工学院) IVIA Lab, Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 探讨当前生成式AI目标与结构设计师等创作者需求的偏差,提出允许受限人机共同创作的系统设计维度,通过试点设计界面和专家研究,展示其对设计空间探索的支持及设计师看法。

Comments Accepted at ICML 2026, Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 57%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27742 2026-07-09 cs.CV 版本更新 57%

TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

TIR-Agent:训练一个探索性且高效的图像修复代理

Guoli Jia, Yisheng Zhang, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou

机构 * Tsinghua University(清华大学) China Unicom(中国联通) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05653 2026-07-08 cs.LG math.OC 新提交 57%

Orthogonal Dendritic Intrinsic Networks: An Architecture for Significance-Ordered, Orthogonal Latent Spaces

正交树突内在网络:一种用于重要性排序、正交潜在空间的架构

Jeanie Schreiber, Tyrus Berry, Zeeshan Ahmed

机构 * George Mason University(乔治梅森大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 研究旨在解决深度自动编码器架构中PCA属性难实现的问题,提出ODIN架构,通过纳入几何约束使潜在维度正交且按方差排序,兼具PCA可解释性与深度网络表达力,还给出理论依据及合成与真实数据集实证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04011 2026-07-07 cs.CL cs.AI 新提交 57%

Separating Representation from Reconstruction Enables Scalable Text Encoders

将表示与重建分离可实现可扩展的文本编码器

Megi Dervishi, Mathurin Videau, Yann LeCun

机构 * FAIR Meta New York University(纽约大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 研究发现自BERT以来编码器变化小,通过冻结主干评估揭示问题源于其扁平设计。提出CrossBERT架构分离高质量编码表示学习与令牌重建,能提高掩码率和梯度收集效率,在相关基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12471 2026-07-07 stat.ML cs.CL cs.ET cs.LG 新提交 57%

Identifiability Without Gaussianity: Symbolic World Models and Near-Infinite Temporal Consistency

无高斯假设的可识别性:符号世界模型与近无限时间一致性

Seth Dobrin, Łukasz Chmiel

机构 * Department of Computer Science, Stanford University(1 计算机科学系,斯坦福大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出物理基础符号架构(PGSA),证明其在非高斯动态系统中实现精确线性可识别性和近无限时间一致性,克服了统计世界模型的高斯边界限制。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18603 2026-07-07 cs.CV 版本更新 57%

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知

Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Technology University of Waterloo(滑铁卢大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 57%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 57%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 57%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新 57%

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12096 2026-07-07 cs.MM cs.CV cs.IT eess.SP math.IT 版本更新 57%

Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications

令牌通信:一种用于跨模态上下文感知语义通信的大模型驱动框架

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Rahim Tafazolli, Mehdi Bennis, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing 100081, China(信息与电子学院,北京理工大学,北京) GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey, Guildford, United Kingdom(5GIC与6GIC,通信系统研究所(ICS), Surrey大学, Guildford,英国) Centre for Wireless Communications, University of Oulu, 90014 Oulu, Finland(无线通信中心,奥卢大学, Oulu,芬兰) School of Computer Science and Engineering, Nanyang Technological University, Singapore 639798(计算机科学与工程学院,南洋理工大学, Singapore)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 介绍令牌通信框架,借助生成基础模型和多模态大语言模型,以令牌为通信单元,在语义通信中利用跨模态上下文信息,提升带宽效率,并给出关键原则与研究方向。

Comments Accepted at IEEE Wireless Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02083 2026-07-03 cs.CV 新提交 57%

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL: 通过自回归标记预测建模扫描路径

Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

机构 * IMPRS-IS

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 将扫描路径预测建模为离散序列任务,利用视觉语言模型的预训练表示,通过简单提示实现个性化偏置和任务特定目标,在MIT1003上信息增益达2.18比特,比DeepGaze III提升46%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01792 2026-07-03 cs.CL cs.LG 新提交 57%

PARTREP: Learning What to Repeat for Decoder-only LLMs

PARTREP: 学习在仅解码器LLM中重复什么

Andikawati P Widjaja, Yongjun Kim, Hyounghun Kim, Jaeho Lee

机构 * Bandung Institute of Technology(万隆理工学院) Pohang University of Science and Technology(浦项科技大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 针对仅解码器LLM因果注意力导致的信息流不对称问题,提出PartRep方法,通过选择最不可预测的token进行重复,在保留大部分性能提升的同时显著降低KV缓存和预计算开销。

Comments 15 pages and 7 figures (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01667 2026-07-03 cs.CV 新提交 57%

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

增强视听视频字幕的时间与跨模态对齐

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) Meituan(美团)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01250 2026-07-03 cs.CY cs.AI cs.CL 新提交 57%

Structuring the Space of Sociotechnical Alignment

构建社会技术对齐的空间

Esra Dönmez, Agnieszka Falenska

机构 * Institute for Natural Language Processing, University of Stuttgart(语言处理研究所,斯图加特大学) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思论坛,斯图加特大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出一个以人为中心的社会技术对齐框架,通过社会科学视角系统定义、论证和评估AI行为的合意性,并基于系统文献综述揭示当前对齐规范中的概念模糊问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31363 2026-07-03 cs.CV 新提交 57%

Language-Assisted Super-Resolution from Real-World Low-Resolution Patches

语言辅助的真实世界低分辨率图像超分辨率

Joonkyu Park, Kyoung Mu Lee

机构 * IPAI, Seoul National University(首尔大学IPAI)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出LA-SR框架,利用视觉语言模型在语言空间中对齐LR和HR图像,通过语言内容损失和语言质量损失实现无配对真实LR图像的超分辨率。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 57%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-07-02 cs.CV 新提交 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31982 2026-07-01 cs.CV 新提交 57%

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) OPPO Research Institute(OPPO研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 57%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 57%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新 57%

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30244 2026-06-30 cs.CV 57%

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

语义驱动的尺度与空间选择实现指代遥感图像分割中的高效跨模态对齐

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

机构 * University of Liverpool, UK(利物浦大学) University of Michigan, USA(密歇根大学) University of Twente, NL(埃因霍温理工大学) University of Bath, UK(巴斯大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出S4ECA框架,通过参数高效微调的双编码器适配器架构,利用语言引导的尺度与空间选择机制实现跨模态对齐,仅更新2.4%骨干参数即在RRSIS-D和RefSegRS数据集上达到最优性能。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29788 2026-06-30 cs.LG 57%

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

MemLeak: 诊断多模态智能体记忆中的信息泄露

Kuan Wang, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.LG

AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。

Comments 23 pages, 3 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29462 2026-06-30 cs.CV 57%

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

MIRROR: 通过Gromov-Wasserstein对齐从语言到图像的语义关系

Hong-Han Wang, Yuntao Wang, Hu Ding

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出MIRROR框架,通过半逆Gromov-Wasserstein问题将语言中的关系先验几何对齐到视觉表示,提升多模态大模型的关系一致性,无需额外参数或推理成本。

Comments Accepted to ECCV 2026. 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29208 2026-06-30 cs.CV 57%

Zero-Gated Language-conditioned Human Motion Prediction

零门控语言条件人体运动预测

Guanhui Qiao, Lu Zhou, Ding Jiang, Jinqiao Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出ZGL模型,通过零初始化的可学习门控将语言描述作为语义先验注入基于DCT的时空Transformer,在Human3.6M和CMU Mocap上提升运动预测精度。

Comments 5 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15632 2026-06-30 cs.CV 57%

A New Method to Capturing Compositional Knowledge in Linguistic Space

一种在语言空间中捕获组合知识的新方法

Jiahe Wan

机构 * School of Computer Science(计算机科学学院) South-Central Minzu University(西南民族大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 提出YUKINO方法,通过文本反转和“no”逻辑正则化,在无需硬负样本的情况下提升视觉语言模型的组合理解能力,在SugarCREPE基准上超越现有多模态SOTA模型8%以上。

Journal ref Neurocomputing, 2026: 133150

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 57%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏