arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 275 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 275 篇

2502.12096 2026-07-07 cs.MM cs.CV cs.IT eess.SP math.IT 版本更新 57%

Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications

令牌通信:一种用于跨模态上下文感知语义通信的大模型驱动框架

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Rahim Tafazolli, Mehdi Bennis, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing 100081, China(信息与电子学院,北京理工大学,北京) GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey, Guildford, United Kingdom(5GIC与6GIC,通信系统研究所(ICS), Surrey大学, Guildford,英国) Centre for Wireless Communications, University of Oulu, 90014 Oulu, Finland(无线通信中心,奥卢大学, Oulu,芬兰) School of Computer Science and Engineering, Nanyang Technological University, Singapore 639798(计算机科学与工程学院,南洋理工大学, Singapore)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 介绍令牌通信框架,借助生成基础模型和多模态大语言模型,以令牌为通信单元,在语义通信中利用跨模态上下文信息,提升带宽效率,并给出关键原则与研究方向。

Comments Accepted at IEEE Wireless Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新 57%

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01718 2026-06-29 cs.LG 版本更新 57%

Accelerating Attention with Basis Decomposition

基于基分解加速注意力机制

Jialin Zhao

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 提出BD Attention(BDA),通过基分解将多头投影重构为紧凑形式,实现无损且架构无关的注意力加速,在DeepSeek-V2-Lite上KV投影加速34%、权重减小25%,困惑度仅增0.02%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09170 2026-06-25 cs.RO cs.AI 版本更新 57%

ZeroWBC: Learning Natural Whole-Body Humanoid Interaction from Human Egocentric Data

ZeroWBC: 从人类自我中心数据学习自然全身人形交互

Haoran Yang, Jiacheng Bao, Yucheng Xin, Haoming Song, Yuyang Tian, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) TeleAI, China Telecom(TeleAI,中国电信)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 提出ZeroWBC框架,利用人类自我中心视频和同步全身运动数据,通过生成-跟踪方法实现无遥操作的人形机器人全身交互控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 57%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新 57%

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20937 2026-06-23 cs.LG 版本更新 57%

Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs

面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解

Kibum Kim, Jiwan Kim, Kyle Min, Yueqi Wang, Jinyoung Moon, Julian McAuley, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) Oracle University of California, San Diego(加州大学圣地亚哥分校) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15967 2026-06-23 cs.CR cs.CV 版本更新 57%

When Safe Concepts Become Unsafe: Multi-Concept Compositional Vulnerabilities in Text-to-Image Models

TwoHamsters:文本到图像模型中多概念组合不安全性的基准测试

Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) CISPA Helmholtz Center for Information Security(信息安全研究中心) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 VLM训练与架构 :LLaVA(abstract_cn);分类 cs.CV

AI总结 本文提出TwoHamsters基准,通过17500个提示测试文本到图像模型在多概念组合不安全性的表现,揭示现有模型和防御机制在处理危险组合生成时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01624 2026-06-23 cs.CV 版本更新 57%

PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练

Minh-Quan Le, Gaurav Mittal, Cheng Zhao, David Gu, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。

Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25148 2026-06-19 cs.AI 版本更新 57%

AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models

AAPA:用于大型语言模型后训练的对抗锚定偏好对齐

Faqiang Qian, Kang An, Weikun Zhang, Ziliang Wang, Xuhui Zheng, Liangjian Wen, Yong Dai, Mengya Gao, Yichao Wu

机构 * Southwest University of Finance and Economics(西南财经大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 提出AAPA框架,通过固定轻量判别器对策略输出与专家响应进行句子级对抗锚定,增强SFT、GRPO等后训练目标,在指令遵循基准上持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01711 2026-06-18 cs.CV 版本更新 57%

Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference

通过纠正失真改进视觉令牌减少以实现高效多模态大语言模型推理

Hyeonwoo Cho, Donghyeon Baek, Yewon Kim, Bumsub Ham

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出RESTORE框架,通过校准位置和注意力失真来改进视觉令牌减少,在保持效率的同时提升多模态大语言模型性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05761 2026-06-16 cs.CV 版本更新 57%

iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

iTRIALSPACE:用于肺CT模型受控评估的可编程虚拟病灶试验

Fakrul Islam Tushar, Umme Hafsa Momy, Joseph Y. Lo, Geoffrey D. Rubin

机构 * Department of Radiology and Imaging Sciences, University of Arizona(亚利桑那大学放射科和影像科学系) Department of Biomedical Engineering, Florida International University(佛罗里达国际大学生物医学工程系) Center for Virtual Imaging Trials, Department of Radiology, Duke University Medical Center(达特茅斯大学医学中心虚拟成像试验中心,放射科)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.CV

AI总结 提出可编程评估框架iTRIALSPACE,通过四阶段流水线(结节分析、试验规范、掩膜插入、CT合成)构建受控虚拟病灶试验,揭示固定基准无法发现的模型缺陷。

Comments 11 pages, 13 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06035 2026-06-16 cs.AI cs.CL 版本更新 57%

Attention, not scale, drives human-AI alignment in multimodal language prediction

注意力,而非规模,驱动多模态语言预测中的人机对齐

Viktor Kewenig, Andrew Lampinen, Samuel A. Nastase, Christopher Edwards, Quitterie Lacome D'Elascombe, Akilles Rechardt, Jeremy I Skipper, Gabriella Vigliocco

机构 * Psychology and Language Science, Experimental Psychology, University College London, London, UK(心理学与语言科学、实验心理学,伦敦大学学院,伦敦,英国) Google Deepmind, Mountain View, US(谷歌DeepMind,山景城,美国) Princeton Neuroscience Institute, Princeton University, Princeton, NJ, USA(普林斯顿神经科学研究所,普林斯顿大学,普林斯顿,新泽西州,美国) Computer Science Department, Exeter University(计算机科学系,埃克塞特大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本研究通过比较五种视觉-语言模型与600名人类在视觉世界范式中的表现,发现添加视觉上下文显著提升模型与人类在预测评分上的一致性,且注意力机制而非模型规模是主要驱动因素。

Comments 39 pages, 6 Figures, published in NPJ Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 57%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-06-10 cs.CV 版本更新 57%

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01802 2026-06-08 cs.SD cs.AI 版本更新 57%

MOSS-Audio Technical Report

MOSS-Audio 技术报告

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen, Ke Chen, Wenxuan Wang, Yang Wang, Yaozhou Jiang, Yi Jiang, Zhengyuan Lin, Ziqi Chen, Zhaoye Fei, Chenghao Liu, Donghua Yu, Jun Zhan, Kang Yu, Kexin Huang, Liwei Fan, Mingshu Chen, Qinyuan Cheng, Ruixiao Li, Shimin Li, Songlin Wang, Xingjian Zhao, Yang Gao, Yitian Gong, Yiyang Zhang, Zhe Xu, Xipeng Qiu

机构 * OpenMOSS Team(开放MOSS团队)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 提出统一音频-语言模型 MOSS-Audio,通过 DeepStack 跨层特征注入和时间标记实现语音、环境声和音乐的理解,在音频字幕、时间感知问答、时间戳转录和音频推理任务上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-17 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00025 2026-08-04 cs.CL 版本更新 50%

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Sreeraj Ramachandran, Elyas Irankhah, Aimee Kendall Roundtree

机构 * Yale University(耶鲁大学) Texas State University(德克萨斯州立大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01049 2026-08-03 cs.CL 版本更新 50%

Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据

Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Yang Yu, Minheng Ni, Wenjun Wang, Yanggan Gu, Shuo Cai, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学) InfiX.ai PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)

专题命中 VLM训练与架构 :LLaVA(abstract)

AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 50%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 50%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15865 2026-07-28 cs.CL 版本更新 50%

An MLIR-Based Compilation Method for Large Language Models

一种基于MLIR的大语言模型编译方法

Pengchao Hu, Zhibin Xin, Yifan Chen, Yangyang Zhou, Liang Wang, Xin Zhang

机构 * Sophgo Inc(算能科技有限公司)

专题命中 VLM训练与架构 :InternVL(abstract)

AI总结 针对大语言模型在专用硬件部署的挑战,提出基于MLIR的编译方法,用TopOp和TpuOp方言表示模型,分阶段编译,在TPU-MLIR编译器等项目实现,支持多种模型及量化部署形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06409 2026-07-22 cs.CR 版本更新 50%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15518 2026-07-21 cs.CL 版本更新 50%

Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models

Squid:长上下文作为节能设备端语言模型的新模态

Wei Chen, Zhiyuan Li, Shuo Xin, Yihao Wang

机构 * Nexa AI

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 研究针对设备端语言模型处理长上下文能耗高、延迟大的问题,提出Dolphin架构,用紧凑解码器提炼上下文信息,结合图像嵌入投影仪编码长文本,经实证评估,该方法提升了能源效率,降低了延迟,为设备端语言模型发展做贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12356 2026-07-17 cs.RO 版本更新 50%

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA

Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15587 2026-07-16 cs.RO 版本更新 50%

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

完美演示造就差劲教师:从关键运动片段学习鲁棒对齐

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新 50%

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05717 2026-07-02 eess.AS 版本更新 50%

Enhancing Audio Captioning with Auxiliary AudioSet Semantics

利用辅助AudioSet语义增强音频描述生成

Shubham Gupta, Adarsh Arigala, Sri Rama Murty Kodukula

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出一种资源高效的自动音频描述生成框架,通过ConvNeXt编码器提取帧级声学表示并融合AudioSet关键词语义,使用紧凑的六层BART解码器生成描述,在Clotho V2和AudioCaps上取得竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29173 2026-07-01 cs.RO 版本更新 50%

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation

TacGen: 触觉是物理世界表征的必要维度——通过可扩展的视觉到触觉对齐与生成解决触觉数据稀缺问题

Wanghao Ye, Aarosh Das, Sihan Chen, Yiting Wang, Bowei Tian, Guoheng Sun, Shwai He, Zheyu Shen, Ziyao Wang, Yexiao He, Zhaoyi Liu, Meng Liu, Yuning Zhang, Meng Feng, Ziyi Wang, Yilong Dai, Yifei Dong, Siyuan Peng, Zhenle Duan, Joshua Liu, Lang Xiong, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Carnegie Mellon University(卡内基梅隆大学) University of Alabama(阿拉巴马大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对触觉数据稀缺问题,提出TacGen方法,通过视觉-触觉对比对齐和潜在空间残差MLP生成器合成触觉潜在表示,在质量、密度、硬度等物理属性预测上显著优于纯视觉模型,并大幅提升触觉操作性能。

Comments 49 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20653 2026-07-01 cs.SE cs.SY eess.SY 版本更新 50%

SysVCoder: An LLM-Driven Framework for Systematic Generation of System-Level Design

SysVCoder: 一种LLM驱动的系统级设计系统性生成框架

Jian Zuo, Junzhe Liu, Xianyong Wang, Chen Liang, Navya Goli, Umamaheswara Rao Tida, Zhenge Jia, Zhaoyan Shen, Mengying Zhao

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出SysVCoder框架,通过两阶段生成流水线、规则对齐机制和领域特定检索增强生成策略,提升Verilog系统级设计的生成质量与效率,在功能正确性上优于现有方法。

Comments This paper is accepted at APPT'26

详情

展开后加载摘要…

URL PDF HTML 收藏