Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
推进全模态具身智能体:从孤立技能到日常物理自主
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
推进全模态具身智能体:从孤立技能到日常物理自主
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。
ASSCG:自动驾驶中快慢LLM规划的恰到好处门控
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Lenovo Group Limited(联想集团)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。
P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析
机构 * Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS)) ; Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出P-MTP框架,通过渐进式多令牌预测和轻量级MTP模块,结合渐进课程损失和置信门控动态草稿,实现文档解析高达5倍加速且精度损失极小。
Brain-Adapter: 一种用于急性颅内病理综合3D CT诊断的双流视觉-语言MIL框架
机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算系)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出Brain-Adapter双流多实例学习框架,利用预训练2D生物医学视觉-语言模型和原始诊断报告,通过文本条件注意力和不确定性感知融合实现3D CT扫描的多标签分类,无需密集标注。
Comments Accepted to MICCAI 2026
DE-FIVE: 通过傅里叶特征和图像向量嵌入检测恶意图像提示
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出DE-FIVE框架,利用傅里叶域特征和图像向量嵌入,无需训练即可检测针对视觉语言模型的恶意图像提示,包括间接提示注入攻击。
GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐
机构 * Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; IntelligentX GmbH
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出GTA-Net,利用合作博弈论实现图像区域与文本的显式对齐,通过二元和三元对齐器提升胸部X光报告生成的临床一致性。
$\phi$-Scene: 物理驱动的图像到3D场景重建
机构 * University of California San Diego(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。
Comments Project page: https://phi-scene.github.io/
HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。
Comments 11 pages, 3 figures, Early accepted at MICCAI 2026
TeleStyle V2:超越内容保持风格迁移的自蒸馏与分布匹配蒸馏
机构 * TeleAI
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出TeleStyle V2,通过自蒸馏数据合成和分布匹配蒸馏,支持四种内容-风格参考组合,解决内容一致性退化问题,性能与Qwen-Image-Edit和Gemini 3 Pro相当。
微调视觉-语言-动作模型所需的层数比你想象的少
机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) ; VinRobotics ; University of Arkansas(阿肯色大学) ; Technical University of Denmark(丹麦技术大学) ; Hanoi University of Science and Technology(河内科技大学) ; KAIST(韩国科学技术院) ; Monash University(莫纳什大学) ; Oldenburg University(奥尔登堡大学) ; DFKI(德国人工智能研究中心) ; University of Stuttgart(斯图加特大学) ; IMPRS-IS(国际马克斯·普朗克智能系统研究学院) ; Stanford University(斯坦福大学) ; Technische Universität Darmstadt(达姆施塔特工业大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。
面向LLM训练的具有形式保证的在线动态批处理
机构 * Tencent(腾讯)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.LG
AI总结 提出在线动态批处理(ODB)系统,在数据加载器侧将批构建延迟到样本真实成本可观测时,解决离线批采样中预处理成本不可见问题,实现1.58-4.43x吞吐量提升,并提供无死锁有界终止的形式化保证。
Comments 29 pages, 3 figures, 21 tables
重新审视用于3D CT报告生成的LLM适应:缩放与诊断先验研究
机构 * Northwestern University(西北大学) ; University of South Dakota(南达科他大学) ; Aalto University(阿尔托大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出RAD3D-Prefix轻量级诊断先验框架,通过冻结大语言模型并融合多标签分类逻辑,在少量可训练参数下实现3D CT报告生成,优于全微调基线并展现强泛化性。
RepFusion:利用多模态先验在表示空间中进行去噪
机构 * Meta AI ; New York University(纽约大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。
Comments Project Page: https://xichenpan.com/repfusion
编码器胜者无法可靠跨VLA骨干网络规模迁移:一种冻结骨干嫁接诊断方法
机构 * Tsinghua University(清华大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出冻结骨干嫁接诊断方法,发现小规模VLA上最优的视觉编码器在大规模骨干上并非最优,编码器选择依赖于骨干网络规模。
Comments 23 pages, 5 figures, 8 tables
DeepJEB++: 基于基础模型驱动的二维潜空间增强的大规模三维工程数据集
机构 * Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院) ; Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) ; Narnia Labs(纳尼亚实验室)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出DeepJEB++框架,通过二维潜空间增强和基础模型,将少量喷气发动机支架种子设计扩展为大规模带仿真标签的三维数据集,实现40倍扩展。
Comments 16 pages, 14 figures. Submitted to ASME Journal of Mechanical Design
FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Nuvatech
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。
CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成
机构 * Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Microsoft(微软) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Alibaba Cloud(阿里云) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :vision-language model(abstract);visual language model(abstract);分类 cs.CV
AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。
Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647
VeriDrive: 可验证的反事实监督用于成本高效的视觉-语言规划
机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出VeriDrive框架,通过结构化感知-评估-修正链生成可验证的反事实监督,降低视觉-语言驾驶规划的数据构建成本,并在nuScenes数据集上验证其有效性。
MODUS:仅解码器的多模态任意到任意建模
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。
Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch
通过潜在激活一致性测量稀疏自编码器中的单语义性
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究针对可解释人工智能中评估稀疏自编码器单语义性的挑战,提出无标签的Tversky单语义性分数(TMS),通过激活集一致性衡量。在多种模型和设置下评估,结果显示TMS受编码器各向异性影响小,能揭示训练动态,还能体现概念删除有效性。
Comments This is a preprint version. A shorter version of this paper has been accepted for presentation and publication in the post-workshop proceedings of the 8th International Workshop on eXplainable Knowledge Discovery in Data Mining (XKDD 2026), co-located with ECML PKDD 2026. The appendix is included only in this preprint and is not part of the peer-reviewed proceedings paper
PhysV2A:用于视频到机器人操作的可达性门控和语义掩码约束的可行性完成
机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) ; University of Liverpool(利物浦大学) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 研究如何将视频衍生的6D对象运动转换为机器人可执行轨迹,提出PhysV2A框架,通过可达性门控选择和语义掩码约束细化可操作性,经真实机器人实验验证,该框架能提升任务成功率、减少运动可行性失败并产生更好轨迹。
当结构化稀疏自编码器跨模态学习一致概念时
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。
DexTele:一种基于运动重定向和自适应力控制的双臂灵巧遥操作系统
机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) ; School of Computing, University of Portsmouth(计算学院,朴茨茅斯大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)
AI总结 研究针对双臂灵巧遥操作中运动重定向和抓取的挑战,提出DexTele系统,通过视觉运动重定向模块和自适应抓取模块,结合运动图编码器、视觉语言模型等技术,实现多平台精确运动重定向与柔顺抓取。
通过奖励门控实现CLIP的选择性测试时去偏
机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract_cn)
AI总结 提出基于强化学习的测试时自适应框架RG-TTA,根据输入对偏见的敏感性选择性应用去偏,在减少偏见的同时保持零样本性能。
Comments 15 pages, 7 figures, 11 tables
CoDex: 无需演示学习组合式灵巧功能性操作
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)
AI总结 提出零演示框架CoDex,结合视觉语言模型与强化学习,自主发现并执行涉及物体内部机制操控的灵巧操作策略,在多种工具任务中验证了其有效性。
Comments IEEE International Conference on Robotics and Automation (ICRA) 2026. Project page: https://robin-lab.cs.utexas.edu/CoDex/
LOPA:通过潜在序数原型对齐增强口语评估
机构 * National Taiwan Normal University(国立台湾师范大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。
差异图:面向医学图像再识别的解剖结构差异对齐
机构 * Khalifa University(哈利法大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Peradeniya(佩拉德尼亚大学) ; MedOS
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出差异图(GoD)方法,通过解剖图结构对齐进行身份比较,提升医学图像再识别的准确性和可解释性,在眼底和胸部X光数据集上Rank-1分别提升7.1和3.1个百分点。
Journal ref MICCAI 2026
X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器
机构 * Square Robot ; City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。
Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/
SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。
SynManDex: 从合成人类预抓取中合成类人灵巧抓取
机构 * Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Shenzhen University(深圳大学) ; Fudan University(复旦大学) ; University of Hong Kong(香港大学) ; ZTE Corporation(中兴通讯股份有限公司)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 提出SynManDex流水线,利用生成的人类预抓取作为启发,通过机器人原生优化实现力闭合接触,生成类人灵巧抓取,在仿真和真实机器人上取得高成功率和类人性。