Retrieval-Augmented Robots via Retrieve-Reason-Act
通过检索-推理-行动实现增强型机器人
机构 * University of California, Santa Cruz(加州大学圣克ruz分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
通过检索-推理-行动实现增强型机器人
机构 * University of California, Santa Cruz(加州大学圣克ruz分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。
见与忆:一种用于网页浏览的多模态代理
机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) ; East China Normal University(华东师范大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%
osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航
机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) ; University of Bonn(波恩大学) ; Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。
Comments accepted at RA-L 2026
OCR 或不是?在 MLLMs 时代重新思考文档信息提取:基于真实世界的大规模数据集
机构 * SAP(SAP公司) ; Stanford University(斯坦福大学)
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文探讨了在 MLLMs 时代是否仍需 OCR,通过大规模数据集评估发现,仅图像输入可达到与 OCR 增强方法相当的性能,并展示了通过精心设计的模式、示例和指示可进一步提升 MLLMs 的表现。
OptMerge: 通过模型融合统一多模态大语言模型的能力与模态
机构 * Tsinghua University(清华大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学)
专题命中 文档图表理解 :grounding(abstract);MLLM(abstract);分类 cs.AI
AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%
在判别与生成分类器之间:重新思考MLLMs用于动作理解
机构 * National University of Singapore(国立新加坡大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出GAD分类器,通过生成辅助判别方法提升封闭集动作理解的准确性和效率,达到SOTA效果。
Comments 22 pages, 9 figures, 16 tables. Accepted by ICLR2026
一种用于自主水路航行在恶劣天气和受限环境下的验证与验证的稳健仿真框架
机构 * Department of Mechanical Engineering, Texas A&M University, College Station, USA(机械工程系,德克萨斯A&M大学,学院站,美国) ; Department of Ocean Engineering, Texas A&M University, College Station, USA(海洋工程系,德克萨斯A&M大学,学院站,美国) ; American Bureau of Shipping, Spring, TX, USA(美国船舶局,斯普林,德克萨斯州,美国)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出了一种稳健的仿真框架,用于验证和验证自主水路航行系统在恶劣天气和受限环境下的性能。
给我剪刀:用于器械传递的碰撞自由双臂手术辅助机器人
机构 * School of Mechanical Engineering and Automation, Beihang University(机械工程与自动化学院,北航)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出了一种碰撞自由的双臂手术辅助机器人,通过视觉-语言模型生成轨迹并实现动态环境中的安全器械传递。
Comments 8 pages, 10 figures. Accepted by IEEE International Conference on Robotics and Automation (ICRA), 2026
VLMFusionOcc3D: 基于VLM的多模态3D语义占位预测
机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥克辛大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 VLMFusionOcc3D通过融合视觉语言模型的语义先验,提升多模态3D语义占位预测的鲁棒性和适应性。
面向MRI多器官异常检测的3D模态感知预训练
机构 * School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院) ; School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) ; Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出MedMAP框架,通过3D MRI的模态感知预训练提升多器官异常检测性能,实验表明其优于现有视觉-语言模型。
Self-Aug: 用于大视觉-语言模型的查询和熵自适应解码
机构 * Arizona State University(亚利桑那州立大学) ; Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出Self-Aug,一种无需训练的解码策略,通过自增强提示和自适应阈值算法提升大视觉-语言模型的事实一致性。
Comments 10 pages, accepted to ICLR 2026
REGAL:一种基于注册表的架构,用于企业遥测中代理AI的确定性接地
机构 * Adobe Inc.(Adobe公司)
专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.AI
AI总结 REGAL提出一种基于注册表的架构,用于企业遥测中代理AI的确定性接地,通过显式架构方法和语义编译提升确定性计算,解决LLM在私有遥测中的接地问题。
SGPA: 基于频谱的语音对齐用于多模态大语言模型中可行的谢普利值解释
机构 * Warsaw University of Technology(华沙技术大学)
专题命中 VLM训练与架构 :multimodal large language model(title)
AI总结 SGPA通过结合连接主义时间分类和频谱边界细化,实现了多模态大语言模型中可行的音频解释,显著减少了模型评估次数并保持了全局轮廓。
Comments Submitted for admission in Interspeech 2026 conference
MMTok: 为VLMs高效推理的多模态覆盖最大化
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
AI总结 MMTok通过多模态覆盖准则提升VLMs推理效率,结合视觉和文本信息优化标记选择,实现性能与速度的平衡。
Comments Accepted by ICLR 2026. Code: https://github.com/Ironieser/mmtok , Project Homepage: https://project.ironieser.cc/mmtok
视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信
机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) ; Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) ; British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)
专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.LG
AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。
量化感知蒸馏用于NVFP4推理精度恢复
机构 * NVIDIA(英伟达)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG
AI总结 本研究提出量化感知蒸馏方法,用于恢复NVFP4量化大型语言模型和视觉-语言模型的推理精度,通过KL散度损失实现有效且稳定的精度恢复。
InstructVLA: 从理解到操作的视觉-语言-动作指令微调
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 InstructVLA通过视觉-语言-动作指令微调,实现了在多模态推理和动作生成之间的平衡,提升了机器人在复杂任务中的操控性能和泛化能力。
Comments 48 pages
可扩展的多语言多模态机器翻译与语音-文本融合
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)
AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。
Comments Accepted in ICLR 2026
基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法
机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) ; National Institute of Advanced Industrial Science(国家工业科学与技术研究院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。
Comments Accepted at LREC2026
视觉-语言模型的半监督少样本适应
机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。
Comments Code: https://github.com/jusiro/SS-Text-U
Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Dyna Robotics(Dyna机器人技术)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。
Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io
知何时退避:基于似然比的最优选择性分类
机构 * Department of Computer Science, National University of Singapore(计算机科学系,国立新加坡大学) ; Smart Systems Institute, National University of Singapore(智能系统研究所,国立新加坡大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于似然比的最优选择性分类方法,通过 Neyman-Pearson 引理统一并改进了选择性分类在协变量偏移下的性能。