arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 70 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2608.19212 2026-08-21 cs.CL cs.CV 新提交 81%

NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection

NepOOC-M:面向OOC检测的尼泊尔语-英语双语基准及多模态架构的对比分析

Sanjeev Khatiwada

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对尼泊尔语OOC虚假信息检测,构建首个尼泊尔语多语言OOC基准NepOOC,评估多模态等架构发现仅文本mBERT性能最优,数据集扩充比架构优化更有效。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20312 2026-08-21 cs.CV 新提交 79%

Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis

Inter-X++:用于多模态人与人交互分析的综合基准

Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv, Yichao Yan, Xin Jin, Zhibo Chen, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(宁波工程学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出多模态人与人交互基准Inter-X++,构建含精细标注的大规模数据集,开发统一HHI框架OpenHHI,其在生成与感知任务上达最优性能,验证了统一表示的有效性。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19666 2026-08-21 cs.CV 新提交 79%

MUST-PET: MUltimodal Self-supervised learning across Tracers for whole-body PET/CT-based lesion segmentation

MUST-PET:用于基于全身PET/CT的病灶分割的跨示踪剂多模态自监督学习

Bashirul Azam Biswas, Amartya Bhattacharya, Biratal Raj Wagle, Matthew E. Maeder, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出MUST-PET多模态自监督学习框架,通过跨示踪剂的上下文感知掩码重建,实现全身PET-CT病灶的标注高效、可泛化分割,性能优于从头训练模型。

Comments Submitted to SPIE CAD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-08-21 cs.CV 版本更新 79%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: this https URL (https://github.com/Chikit-WONG/spatialGraph)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 78%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态评测 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14728 2026-08-21 cs.MM cs.CL cs.CV cs.CY 版本更新 75%

Mitigating GenAI-Powered Evidence Pollution for Out-Of-Context Misinformation Detection

缓解生成式人工智能(GenAI)驱动的证据污染以检测脱离上下文的虚假信息

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 该研究针对GenAI污染证据削弱OOC多模态虚假信息检测的问题,提出跨模态证据重排序与声明-证据推理策略,在基准数据集上验证了其对现有检测器鲁棒性的提升效果。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20122 2026-08-21 cs.CV 新提交 57%

ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation

ArmorOCR:基于观测迁移自蒸馏的 grounded 对抗性视觉感知

Linhan Cao, Siyuan Li, Jun Lan, Liangbo He, Guannan Li, Xiaolei Huang, Jun Jia, Shuheng Zhou, Huijia Zhu, Weiqiang Wang, Wei Sun

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ArmorOCR两阶段训练框架,结合OPSD与GRPO,推出含390幅图像的AdvSpot基准,可提升对抗性OCR感知能力并保留通用OCR性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10668 2026-08-21 cs.CV 版本更新 57%

XDen-1K: A Density Field Dataset of Real-World Objects

XDen-1K:一个现实世界物体的密度场数据集

Jingxuan Zhang, Tianqi Yu, Yatu Zhang, Jinze Wu, Kaixin Yao, Jingyang Liu, Yuyao Zhang, Jiayuan Gu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 XDen-1K通过提供大规模现实世界物体的多模态数据,推动物理基础视觉推理和具身AI的研究。

Comments Project Page: this https URL (https://xden-1k.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02489 2026-08-21 cs.CV 版本更新 57%

Object-aware graph matching network for cross-domain remote sensing image localization

面向跨域遥感图像定位的感知对象图匹配网络

Tao Liu, Kan Ren, Qian Chen

机构 * Jiangsu Key Laboratory of Spectral Imaging and Intelligent Sense, Nanjing University of Science and Technology(江苏光谱成像与智能感知重点实验室,南京理工大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对跨域跨模态遥感图像地理定位难题,提出感知对象图匹配框架,构建IRVL328数据集,在SUES-200、IRVL328等数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19735 2026-08-21 cs.LG 新提交 50%

RecPFN: Prior-Fitted Networks for In-Context-Based Recommendations

RecPFN:用于基于上下文的推荐的先验拟合网络

En Zhi Tan, Jia Xiang Lim, Bryan Lijie Chew, Tze Minh Ng, Benjamin Yan Han Yap

机构 * SAP SE(思爱普公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 RecPFN是一种将上下文学习引入序列推荐的先验拟合网络,经合成点击流环境预训练,在八个基准测试中实现最优零样本性能,部署高效且鲁棒,为通用推荐系统提供新路径。

Comments 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18632 2026-08-21 cs.RO 版本更新 50%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 11 篇

2608.19739 2026-08-21 cs.CV cs.AI cs.LG 新提交 84%

Question-Guided Evidence Acquisition for Multimodal Visual Question Answering

面向多模态视觉问答的问题引导式证据获取

Alin-Ionut Popa

机构 * Amazon Inc.(亚马逊公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态视觉问答中模型读取文档不可靠的问题,提出Q-Guide智能体引导感知,在两个数据集上优于基线方法,且增益来自精准感知引导而非复杂控制逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20237 2026-08-21 cs.AI 新提交 79%

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

面向多模态大语言模型的符合规则的视觉空间规划

Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) Yinwang Intelligent Technology Co., Ltd(银湾智能科技有限公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型的规则遵循空间规划问题,构建了RuleMaze基准,提出语言-逻辑-函数混合方法和解耦多模态规划(DMP),提升了规则遵循度与规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13854 2026-08-21 cs.CL 版本更新 79%

SPyCE: Skill-Policy Co-evolution for Multimodal Agents

SPyCE:多模态智能体的技能-策略协同进化

Ru Zhang, Weijie Qiu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态智能体,提出SPyCE框架,将推理轨迹提炼为分层技能库与策略协同进化,执行技能捕获局部操作,工作流技能编码高级先验,实验证明该框架优于基线,为构建多模态智能体提供新范式。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19537 2026-08-21 cs.RO 新提交 78%

Multimodal Trajectory Planning for Surface Vehicles using Turning Circle-based Control Barrier Functions

基于转向圆型控制障碍函数的水面航行器多模态轨迹规划

Changyu Lee

机构 * Kongju National University(公州国立大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文针对动态环境下自主水面航行器,提出结合MPC与TC-CBF的无引导路径多模态轨迹规划框架,可提升避碰成功率、减少安全违规并缓解局部极小问题。

Comments This work has been submitted to an Elsevier journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02794 2026-08-21 cs.AI 版本更新 77%

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding

CharTool: 集成工具的视觉推理用于图表理解

Situo Zhang, Yifan Zhang, Zichen Zhu, Da Ma, Lei Pan, Danyang Zhang, Zihan Zhao, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室) AISpeech Co., Ltd.(思必驰科技股份有限公司)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20320 2026-08-21 cs.AI cs.CL 新提交 62%

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

一种用于主动数据收集、出行行为建模及天气敏感需求预测的智能体方法

Narges Ahmadi (1), Yubo Jiao (1), Jônatas Augusto Manzolli (1), Jiangbo Yu (1), Luis Miranda-Moreno (1) ((1) McGill University)

机构 * McGill University(麦吉尔大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出三智能体工作流,结合对话式调查、传统建模与多模态LLM预测,基于学生通勤数据实现天气敏感出行需求预测,视觉配置模型准确率达71.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20129 2026-08-21 cs.MA cs.CL cs.CV 新提交 62%

Multi-Agent Orchestration with the Common-Sense Reasoning Capabilities of LLMs for Autonomous Driving

结合大语言模型常识推理能力的多智能体协同框架用于自动驾驶

Mehdi Azarafza, Faezeh Pasandideh, Ali Ehteshami Bejnordi, Stefan Henkler, Achim Rettberg

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究针对自动驾驶中强化学习等方法的上下文推理缺陷,提出结合LLM常识推理的混合多智能体协同框架,经CARLA场景验证可保留结构化控制与安全机制,具备应用潜力。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-21 cs.AI cs.MM 版本更新 62%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Shiqin Wang, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments This work was accepted by WISE2026. 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19794 2026-08-21 cs.AI cs.RO 新提交 57%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11665 2026-08-21 cs.CV cs.RO 版本更新 57%

UAV-Based Infrastructure Inspections: A Literature Review and Proposed Framework for AEC+FM

基于无人机的基础设施检查:面向AEC+FM的文献综述与提出框架

Amir Farzin Nikkhah, Dong Chen, Bradford Campbell, Somayeh Asadi, Arsalan Heydarian

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文综述了无人机在基础设施检查中的应用,提出框架整合多模态数据与Transformer架构,以提高检测准确性和可靠性,未来研究方向包括轻量级AI模型和合成数据集。

Comments Accepted for publication in the Proceedings of the International Conference on Computing in Civil Engineering (i3CE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19964 2026-08-21 cs.LG 新提交 50%

G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs

G-MARK:基于知识图谱的协同驾驶接地多智能体推理

Bhavya Gupta, Onat Gungor, Tajana Rosing

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) West Virginia University(西弗吉尼亚大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出 G-MARK 框架,通过知识图谱实现协同驾驶多智能体推理,提升遮挡推理与控制选择性能,减小通信负载,效果优于现有基线。

Comments Accepted for oral presentation at the 25th IEEE International Conference on Machine Learning and Applications (ICMLA'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2608.19942 2026-08-21 cs.CL 新提交 88%

Dynamic Gated Cross-Modal Fusion with Sarcastic-aware Contrastive Regularization for Multimodal Sarcasm Detection

面向多模态反讽检测的带反讽感知对比正则化的动态门控跨模态融合方法

Hao Guo, Subin Huang, Junjie Chen, Zhifa Geng, Sanmin Liu, Chao Kong

机构 * Renmin University of China(中国人民大学) Anhui Polytechnic University(安徽工程大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

AI总结 该研究针对多模态反讽检测任务,提出集成动态门控跨模态融合与SaCR正则化的MSD框架,经实验验证其性能优于多个强基线模型。

Comments Accepted to SEKE 2026. 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19710 2026-08-21 cs.CV cs.AI 新提交 84%

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

Mohammad Arif Ul Alam

机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19971 2026-08-21 cs.CL 新提交 83%

Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction

基于迭代代理修正的鲁棒性不完整多模态情感分析

Zhifa Geng, Subin Huang, Hao Guo, Junjie Chen, Sanmin Liu, Chao Kong

机构 * Renmin University of China(中国人民大学) Anhui Polytechnic University(安徽工程大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对不完整多模态情感分析中一次性代理初始化粗糙的问题,提出迭代代理修正框架,在MOSI等数据集上实现了优于基线的鲁棒情感预测。

Comments Accepted to SEKE 2026. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02092 2026-08-21 cs.CV cs.MM 版本更新 81%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19669 2026-08-21 cs.CV cs.LG 新提交 79%

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

搭建心智:优化多模态推理的潜在视觉目标表示

Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

机构 * Google DeepMind(谷歌DeepMind) UC San Diego(加州大学圣迭戈分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对潜在推理框架的 SFT 阶段潜在表示对齐差、RL 阶段缺乏探索性潜在轨迹的局限,提出 Scaffolding Minds,学习专用搭建编码器与 RL 采样器的均值方差,在多基准任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07687 2026-08-21 eess.IV cs.CV 版本更新 79%

FermatSyn: SAM2-Enhanced Bidirectional Mamba with Isotropic Spiral Scanning for Multi-Modal Medical Image Synthesis

FermatSyn: 基于改进双向Mamba的多模态医学图像合成方法

Feng Yuan, Yifan Gao, Haoyue Li, Xin Gao

机构 * USTC(中国科学技术大学) SII(上海信息研究所)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 FermatSyn通过改进的双向Mamba结合Fermat螺旋扫描策略,解决多模态医学图像合成中全局一致性与局部细节的平衡问题,提升合成图像质量与临床应用价值。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19726 2026-08-21 cs.CL cs.CV cs.LG 新提交 79%

Projector Is All You Train

仅训练投影器就足够

Nyx Iskandar, Saathvik Selvan, Slater Victoroff

机构 * Ramen VR(拉面VR公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19492 2026-08-21 cs.LG cs.RO 新提交 78%

Beyond Multimodal Alignment: Certifying Physical Language through Response Substitution and Ordered Execution

超越多模态对齐:通过响应替换与有序执行验证物理语言

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出DBOSC方法,在Cluster Haptic数据集与弹塑性系统中验证了多模态物理表示的可执行含义,明确了执行器、图表等因素对动作组合的影响,区分了多项可测试的操作能力成就。

详情

展开后加载摘要…

URL PDF HTML 收藏