arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2607.10655 2026-07-14 cs.RO 新提交 50%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06055 2026-07-08 cs.HC cs.CL 新提交 50%

Nested Episodic State Topology (NEST): A Graph-Theoretic Architecture of Cognitive States

嵌套情节状态拓扑(NEST):认知状态的一种图论架构

Ishant

机构 * Ishant(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究提出NEST图论架构用于认知建模,将概念等表示为带类型加权图,通过多种运算符和工具包构成核心,还包括现象签名等实例化内容,为后续相关工作提供透明表示基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 50%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新 50%

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02590 2026-07-07 cs.SE 新提交 50%

OmniPresent: Generating Coherent Presentation Suites from Scientific Papers

OmniPresent:从科学论文生成连贯的演示文稿套件

Qianli Ma, Jipeng Xiao, Siyu Wang, Zhiheng Tian, Wangyu Feng, Shibo Wang, Chang Guo, Shuochen Chang, Qingyang Liu, Zhipeng Zhang

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 研究如何将静态论文转化为动态媒体,提出OmniPresent框架,采用可渲染HTML表示和自校正循环解决模态冲突,还发布数据集与评估协议,生成的演示文稿套件质量高。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05717 2026-07-02 eess.AS 版本更新 50%

Enhancing Audio Captioning with Auxiliary AudioSet Semantics

利用辅助AudioSet语义增强音频描述生成

Shubham Gupta, Adarsh Arigala, Sri Rama Murty Kodukula

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出一种资源高效的自动音频描述生成框架,通过ConvNeXt编码器提取帧级声学表示并融合AudioSet关键词语义,使用紧凑的六层BART解码器生成描述,在Clotho V2和AudioCaps上取得竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29173 2026-07-01 cs.RO 版本更新 50%

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation

TacGen: 触觉是物理世界表征的必要维度——通过可扩展的视觉到触觉对齐与生成解决触觉数据稀缺问题

Wanghao Ye, Aarosh Das, Sihan Chen, Yiting Wang, Bowei Tian, Guoheng Sun, Shwai He, Zheyu Shen, Ziyao Wang, Yexiao He, Zhaoyi Liu, Meng Liu, Yuning Zhang, Meng Feng, Ziyi Wang, Yilong Dai, Yifei Dong, Siyuan Peng, Zhenle Duan, Joshua Liu, Lang Xiong, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Carnegie Mellon University(卡内基梅隆大学) University of Alabama(阿拉巴马大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对触觉数据稀缺问题,提出TacGen方法,通过视觉-触觉对比对齐和潜在空间残差MLP生成器合成触觉潜在表示,在质量、密度、硬度等物理属性预测上显著优于纯视觉模型,并大幅提升触觉操作性能。

Comments 49 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20653 2026-07-01 cs.SE cs.SY eess.SY 版本更新 50%

SysVCoder: An LLM-Driven Framework for Systematic Generation of System-Level Design

SysVCoder: 一种LLM驱动的系统级设计系统性生成框架

Jian Zuo, Junzhe Liu, Xianyong Wang, Chen Liang, Navya Goli, Umamaheswara Rao Tida, Zhenge Jia, Zhaoyan Shen, Mengying Zhao

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出SysVCoder框架,通过两阶段生成流水线、规则对齐机制和领域特定检索增强生成策略,提升Verilog系统级设计的生成质量与效率,在功能正确性上优于现有方法。

Comments This paper is accepted at APPT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04334 2026-07-01 cs.SE 版本更新 50%

Artificial Intelligence for Software Architecture: Literature Review and the Road Ahead

人工智能用于软件架构:文献综述与未来之路

Alessio Bucaioni, Martin Weyssow, Junda He, Yunbo Lyu, David Lo

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 通过系统文献综述,识别AI在软件架构中应用的14个主题领域和6个AI特有挑战,并基于实证访谈提出五大战略支柱的研究路线图。

Comments 37 pages, accepted for publication in TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30518 2026-06-30 cs.CL 50%

Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts

基于体制感知的同行专业化方法,用于在异构知识冲突下实现稳健的检索增强生成

Bo Wang, Heyan Huang, Yaolin Li, Yanghao Zhou, Jiahao Teng, Ziyi Yang, Ge Shi, Chong Feng

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出RAPS-DA框架,通过样本级三体制划分(接地、仲裁、抵抗)和token级双选择器,解决RAG中异构知识冲突问题,在固定模型规模下超越多种基线。

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30093 2026-06-30 cs.CL cs.IR 50%

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

基于Token共现图的高效检索增强生成

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

机构 * Università Politecnica delle Marche(波尔蒂纳拉理工大学) Università di Modena e Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出TIGRAG框架,利用滑动窗口共现统计构建Token共现知识图谱,结合图语义扩展和神经重排序实现多跳推理,在三个QA基准上优于稠密检索和图RAG方法,同时降低索引和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29660 2026-06-30 physics.hist-ph astro-ph.CO hep-ph hep-th 50%

What Naturalness Measures: Fine-Tuning and Informational Invariants in Cosmology and Dark Matter

自然性衡量什么:宇宙学和暗物质中的微调与信息不变量

Stefano Profumo

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文论证自然性不是客观概率或审美偏好,而是参数到可观测量映射的普适类,构成信息不变量;通过引力与暗物质候选者分析,展示微调追踪丰度映射的解析结构而非候选者性质。

Comments Follows companion papers 2606.21586 (Cosmology as Representation: Informational Invariance and the Limits of Scientific Realism) and 2606.12775 (Are Primordial Black Holes a Natural Dark Matter Candidate?). Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22480 2026-06-23 cs.RO 新提交 50%

ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation

ARP:通过视觉对齐与迭代细化增强机器人操作的量化技能抽象

Yuntian Wang, Zesheng Jia, Yuhui Duan, Qibing Wang, Yang Liu, Song Wang, Siao Liu, Jin Wang

机构 * School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) Key Laboratory of General Artificial Intelligence and Large Models in Provincial Universities, Soochow University(苏州大学省高校通用人工智能与大模型重点实验室) College of Mechanical and Electronic Engineering, China Jiliang University(中国计量大学机电工程学院) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院) Leju Robotics(乐聚机器人)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出ARP框架,通过视觉-动作对比对齐和迭代残差头细化,解决离散量化技能中的语义弱对齐和精度损失问题,在LIBERO和Meta-World基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20890 2026-06-23 cs.CL cs.IR 新提交 50%

Topic-to-Timestamp Alignment by Constrained Evidence Selection

通过约束证据选择的主题到时间戳对齐

Zeynep Yılbırt, Marina Litvak, Michael Färber

机构 * TU Dresden(德累斯顿工业大学) SpeechMind GmbH(SpeechMind 公司) Shamoon College of Engineering(沙蒙工程学院) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20772 2026-06-23 cs.RO eess.IV 新提交 50%

Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction

注意特权到摄像头的差距:面向摄像头优先开环路径预测的以参与者为中心的侧车监督

Feeza Khan Khanzada, Jaerock Kwon

机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对摄像头优先开环路径预测中缺乏对道路参与者显式监督的问题,提出侧车监督方法,利用模拟器生成的参与者标签(如相关性、短时运动)训练模型,在部署时无需额外输入,最终将终点位移误差降低32.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13402 2026-06-23 cs.HC cs.IR cs.MM 50%

InfoCIR: Multimedia Analysis for Composed Image Retrieval

InfoCIR:面向复合图像检索的多媒体分析

Ioannis Dravilas, Ioannis Kapetangeorgis, Anastasios Latsoudis, Conor McCarthy, Gonçalo Marcelino, Marcel Worring

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 InfoCIR通过整合检索、可解释性与提示工程,提供交互式界面,帮助用户理解多模态提示与嵌入空间的交互,提升模型开发中的洞察力生成。

Comments 9+2 pages, 8 figures. Accepted for publication in IEEE PacificVis 2026 (Conference Track). Interactive composed image retrieval (CIR) and ranking explanation

Journal ref 2026 IEEE 19th Pacific Visualization Conference (PacificVis), Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22354 2026-06-23 cs.RO 版本更新 50%

LLM-Based Generalizable Hierarchical Task Planning and Execution for Heterogeneous Robot Teams with Event-Driven Replanning

基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划

Suraj Borate, Bhavish Rai B, Vipul Pardeshi, Madhu Vadali

机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)

专题命中 VLM训练与架构 :VLM(abstract_cn)

AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。

Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18656 2026-06-18 cs.CL 新提交 50%

The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

错误的正确:量化和定位大语言模型中的失调对齐

Naihao Deng, Yiming Feng, Chimaobi Okite, Kaijian Zou, Lu Wang, Rada Mihalcea, Yulong Chen

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12227 2026-06-17 cs.CL 版本更新 50%

A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

结合在线优化与蒸馏以提升大语言模型的长上下文推理能力

Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出dGRPO方法,结合在线优化与蒸馏,通过强教师模型提供密集指导,提升长上下文推理能力,同时保持短上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19937 2026-06-17 cs.CL cs.SD eess.AS 版本更新 50%

ALAS: An Automatic Latent Alignment Score for Audio Language Models

ALAS:音频语言模型的自动潜在对齐分数

Pooneh Mousavi, Yingzhi Wang, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(Concordia 大学) Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) Centrale Supelec(Centrale Supelec 研究院) Laval University(Laval 大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15325 2026-06-16 cs.CL 新提交 50%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31506 2026-06-11 cs.IR cs.CL 版本更新 50%

Evaluating Factual Density in Multi-Source RAG: A Study in Medical AI Accuracy

评估多源RAG中的事实密度:医学AI准确性研究

Michael R. DeMarco

机构 * NexusAgentics

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 针对标准RAG管道因专家盲视效应而忽视高密度事实证据的问题,提出事实密度(FD*)作为检索优化信号,通过概率事实性分析预处理和Z-score归一化消除长度偏差,在HealthFC基准上实现100%系统综述覆盖率。

Comments 16 pages, 8 tables. Includes Experiment 3 results (n=11, Wilcoxon p=0.0619). Preliminary findings; powered Experiment 3 and Graph RAG extension identified as future work. Updated from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07402 2026-06-08 cs.CL 新提交 50%

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian, Wei Chen, Junle Chen, Yuqian Wu, Fangyuan Zhang, Qintian Guo, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Chemical Technology(北京化工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) Tencent Hy(腾讯(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07342 2026-06-08 cs.CL cs.NE 新提交 50%

LLM-Guided Evolution for Medical Decision Pipelines

LLM引导的医疗决策流程进化

Ivan Sviridov, Artem Oskin, Ivan Panin, Iaroslav Bespalov, Dmitry Dylov, Ivan Oseledets, Aleksandr Nesterov

机构 * Sber AI Lab(Sber AI实验室) AIRI

专题命中 VLM训练与架构 :VLM(abstract_cn)

AI总结 提出LLM引导的MAP-Elites进化方法,无需微调即可优化医疗决策流程,在分诊、咨询和图像分类任务中超越手工设计基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04719 2026-06-04 cs.CL 50%

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

基于查询的跨模态投影器增强Mamba多模态大语言模型

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology / Korea, Republic of(韩国科学技术院) University of Illinois in Urbana-Champaign / United States of America(伊利诺伊大学厄巴纳-香槟分校) Korea University / Korea, Republic of(韩国大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 提出基于查询的跨模态投影器,通过交叉注意力压缩视觉令牌,消除手动设计2D扫描顺序的需求,提升Mamba多模态LLM的性能和吞吐量。

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03240 2026-06-03 cs.RO 50%

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models

GeoAlign: VLA模型中的状态引导空间对齐超越语义

Yizhi Chen, Zhanxiang Cao, Xinyi Peng, Yixiao Zheng, Xiaxi Si, Yiheng Li, Liyun Yan, Keqi Zhu, Xueyun Chen, Shengcheng Fu, Tianyue Zhan, Yufei Jia, Jinming Yao, Yan Xie, Kun Wang, Cewu Lu, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Jingdezhen Ceramic University(景德镇陶瓷大学) Tsinghua University(清华大学) HONOR(HONOR公司) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出GeoAlign架构,通过RGB几何分支的后训练和机器人本体状态引导的几何特征查询,实现几何感知的空间对齐和动态可供性选择,在多个基准上取得高性能。

Comments 20 pages, 9 figures, 8 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-06-02 cs.CL 50%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00519 2026-06-02 cs.RO 50%

DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning

DriveAnchor: 用于自动驾驶规划的渐进式基于锚点的流学习

Limin Yan, Haoyun Tang, Yutao Qiu, Hongqing Liu, Haoyu Xu

机构 * Meituan Autonomous Driving(美团自动驾驶) Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出三阶段框架DriveAnchor,通过示范流预训练、引导流后训练和奖励精炼流微调,实现行为多样性、可控性和安全性,在200万场景中近距碰撞率降低89%,平均奖励提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29163 2026-05-29 eess.IV 50%

BCER Agent: Reliable Long-Horizon MRI Workflow Execution via Compilation, Artifact Binding, and Bounded Local Recovery

BCER Agent: 通过编译、工件绑定和有界局部恢复实现可靠的长期MRI工作流执行

Ziyang Long, Xinqi Li, Junzhou Chen, Yifan Gao, Debiao Li, Hsin-Jung Yang

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 提出BCER控制器架构,通过解耦高层规划与执行、有界局部恢复机制,在长链MRI工作流上实现端到端执行一致改进,并保持输出与中间工件的可审计关联。

Comments Pre-review submitted version of a paper accepted to MICCAI 2026. The final authenticated version will be available on SpringerLink

详情

展开后加载摘要…

URL PDF HTML 收藏