arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-10 至 2026-03-10 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 16 篇

2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 73%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15205 2026-03-10 cs.CV 70%

Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation

利用幻觉减少可提示分割中的手动提示依赖

Jian Hu, Jiayi Lin, Junchi Yan, Shaogang Gong

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ProMaC框架,通过利用MLLM幻觉挖掘任务相关信息,提升分割精度与遮罩生成效果。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08059 2026-03-10 cs.CV cs.AI 62%

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

ImageEdit-R1: 通过强化学习提升多智能体图像编辑

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui

机构 * National University of Singapore(新加坡国立大学) Adobe Research(Adobe研究)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19195 2026-03-10 cs.CV cs.AI 62%

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

重新思考驾驶世界模型作为感知任务的合成数据生成器

Kai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei, Xiangyu Guo, Zhenxin Zhu, Kalok Ho, Lijun Zhou, Bohan Zeng, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Dream4Drive通过生成高质量的合成数据提升自动驾驶感知任务性能

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00790 2026-03-10 cs.CV cs.AI 62%

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云(AMAP))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08589 2026-03-10 cs.CV 57%

CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing

CARE-Edit:基于条件的专家路由用于上下文图像编辑

Yucheng Wang, Zedong Wang, Yuetong Wu, Yue Ma, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 CARE-Edit通过条件感知的专家路由提升上下文图像编辑的性能和稳定性

Comments Accepted by CVPR 2026. Project page: https://care-edit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07940 2026-03-10 hep-ex cs.AI 57%

AI Agents, Language, Deep Learning and the Next Revolution in Science

人工智能代理、语言、深度学习与科学的下一次革命

Ke Li, Beijiang Liu, Bruce Mellado, Changzheng Yuan, Zhengde Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于深度学习的智能代理作为科学方法的下一次进化,通过多代理推理框架在粒子物理中实现科学发现的扩展与知识生产的革新。

Comments This perspective paper is accepted by Frontier of Physics

Journal ref Front. Phys., 2026, 21(9): 096401

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07430 2026-03-10 cs.CV 57%

Disentangled Textual Priors for Diffusion-based Image Super-Resolution

解耦文本先验用于基于扩散的图像超分辨率

Lei Jiang, Xin Liu, Xinze Tong, Zhiliang Li, Jie Liu, Jie Tang, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07144 2026-03-10 cs.CV 57%

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

CanoVerse: 3D对象可扩展规范化的数据集用于生成和姿态

Li Jin, Yuchen Yang, Weikai Chen, Yujie Wang, Dehao Hao, Tanghui Jia, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Li Yuan, Long Quan, Xin Wang, Xueying Qin

机构 * SDU(1 南开大学) LIGHTSPEED(2 LIGHTSPEED) UNC Chapel Hill(3 匹兹堡大学柴尔德斯分校) HKUST(4 香港理工大学) PKU(5 北京大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 CanoVerse通过大规模规范3D数据集提升3D生成稳定性,实现跨模态检索与零样本点云方向估计

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07093 2026-03-10 cs.CV 57%

Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction

面向自然双人互动的人类偏好对齐的面部表情生成

Xu Chen, Rui Gao, Xinjie Zhang, Haoyu Zhang, Che Sun, Zhi Gao, Yuwei Wu, Yunde Jia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于人类反馈的面部表情生成方法,通过动作学习和强化学习策略实现自然双人互动中与人类偏好的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 50%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04436 2026-03-10 cs.RO cs.SY eess.SY 50%

PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization

PAD-TRO: 用于直接轨迹优化的投影增强扩散模型

Jushan Chen, Santiago Paternain

机构 * Department of Electrical, Computer, and Systems Engineering, Rensselaer Polytechnic Institute(电气、计算机与系统工程系,罗切斯特理工学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 PAD-TRO提出了一种基于模型的扩散方法,通过无梯度投影机制直接生成状态序列,实现了在四旋翼航点导航中零动态可行性误差和更高的成功率。

Comments Final manuscript. Accepted for publication at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09889 2026-03-10 cs.RO 50%

Diffusion-SAFE: Diffusion-Native Human-to-Robot Driving Handover for Shared Autonomy

Diffusion-SAFE: 基于扩散模型的人机协同驾驶交接机制

Yunxin Fan, Monroe Kennedy

专题命中 多模态生成 :multimodal(abstract)

AI总结 Diffusion-SAFE通过基于扩散模型的闭环框架实现安全的人机协同驾驶交接,支持从演示中直接进行安全评估和计划生成,实验显示在模拟和真实赛车中均取得高交接成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 37 篇

2603.06578 2026-03-10 cs.CV 83%

Multimodal Large Language Models as Image Classifiers

多模态大语言模型作为图像分类器

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学普拉茨视觉识别组)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过修正评估协议和真实标签问题,发现多模态大语言模型在图像分类中的表现受注释质量影响显著,且能辅助人类注释者提升数据集整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05867 2026-03-10 cs.CV 83%

TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis

TumorChain: 交错多模态链式推理用于可追溯的临床肿瘤分析

Sijing Li, Zhongwei Qiu, Jiang Liu, Wenqiao Zhang, Tianwei Lin, Yihan Xie, Jianxiang An, Boxiang Yun, Chenglin Yang, Jun Xiao, Guangyu Guo, Jiawen Yao, Wei Liu, Yuan Gao, Ke Yan, Weiwei Cao, Zhilin Zheng, Tony C. W. Mok, Kai Cao, Yu Shi, Jiuyu Zhang, Jian Zhou, Beng Chin Ooi, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里集团达摩院) Hupan Lab(虎扑实验室) Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所) Shengjing Hospital of China Medical University(中国医科大学盛京医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 TumorChain通过多模态交错推理框架提升临床肿瘤分析的可追溯性和准确性。

Comments Accepted at ICLR 2026. 10 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06985 2026-03-10 cs.CV 83%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06681 2026-03-10 cs.CV 83%

RADAR: A Multimodal Benchmark for 3D Image-Based Radiology Report Review

RADAR:用于基于3D图像的放射学报告审查的多模态基准

Zhaoyi Sun, Minal Jagtiani, Wen-wai Yim, Fei Xia, Martin Gunn, Meliha Yetisgen, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) Microsoft Health AI(微软健康AI)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 RADAR是一个用于放射学报告审查的多模态基准,通过3D医学图像与初步报告及候选编辑的配对,评估模型在细粒度临床推理和图像-文本对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14613 2026-03-10 cs.CL cs.AI cs.CV 82%

Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models

多模态、多任务、多标准自动评估与视觉语言模型

Masanari Ohi, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI NII LLMC(日本国立信息与通信技术研究所语言模型中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HarmonicEval,一种无需参考的多任务多标准自动评估指标,通过聚合标准评分提升与人类判断的相关性,并构建MMHE基准测试多任务场景下的评估泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11202 2026-03-10 cs.CV cs.AI cs.LG 81%

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

一种鲁棒的不完整多模态低秩适应方法用于情感识别

Xinkui Zhao, Jinsong Shu, Yangyang Wu, Guanjie Cheng, Zihe Liu, Naibo Wang, Shuiguang Deng, Zhongle Xie, Jianwei Yin

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MCULoRA方法,通过解耦模态组合的共享信息和动态调整参数微调,提升不完整多模态学习模型的训练效率和下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11024 2026-03-10 cs.LG cs.AI cs.DC 79%

Co-LoRA: Collaborative Model Personalization on Heterogeneous Multi-Modal Clients

Co-LoRA:在异构多模态客户端上的协同模型个性化

Minhyuk Seo, Taeheon Kim, Hankook Lee, Jonghyun Choi, Tinne Tuytelaars

机构 * KU Leuven(库勒芬大学) Seoul National University(首尔国立大学) Sungkyunkwan University(成均馆大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Co-LoRA通过任务相关性感知的模型聚合和维度不变模块,实现了在异构多模态客户端上的协同模型个性化,提升了在异构场景下的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 79%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07486 2026-03-10 cs.CV 79%

Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection

多模态解耦与耦合网络用于抗干扰的3D目标检测

Rui Ding, Zhaonian Kuang, Yuzhe Ji, Meng Yang, Xinhu Zheng, Gang Hua

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Intelligent Transportation Thrust of the Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(系统枢纽智能交通方向,香港科技大学(广州)) Multimodal Experiences Research Lab, Dolby Laboratories(多模态体验研究实验室,Dolby实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态解耦与耦合网络,通过分离和重新耦合不同模态特征以提高在数据损坏下的3D目标检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07443 2026-03-10 cs.CV 79%

Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models

Med-Evo: 医疗多模态大语言模型的测试时自演化

Dunyuan Xu, Xikai Yang, Juzheng Miao, Yaoqian Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(计算机科学与工程系,香港中文大学,香港,中国) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong, Hong Kong, China(医学智能与XR研究所,香港中文大学,香港,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Med-Evo通过无标签强化学习和伪标签技术提升医疗多模态大语言模型性能,实验表明在医疗VQA任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 79%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24118 2026-03-10 cs.RO cs.AI 79%

LagMemo: Language 3D Gaussian Splatting Memory for Multi-modal Open-vocabulary Multi-goal Visual Navigation

LagMemo: 语言3D高斯点云记忆用于多模态开放词汇多目标视觉导航

Haotian Zhou, Xiaole Wang, He Li, Zhuo Qi, Jinrun Yin, Haiyu Kong, Jianghuan Xu, Huijing Zhao

机构 * Key Laboratory of Machine Perceptions (MOE), School of Intelligence Science and Technology, Peking University(机器感知重点实验室(教委)、智能科学与技术学院、北京大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 LagMemo通过语言3D高斯点云记忆实现多模态开放词汇多目标视觉导航,有效提升多目标定位性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07130 2026-03-10 cs.SD eess.AS 79%

Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals

迈向多模态工业故障分析:一个包含音频和振动信号的单速链式输送机数据集

Zhang Chen, Yucong Zhang, Xiaoxiao Miao, Ming Li

机构 * Digital Innovation Research Center, Duke Kunshan University(杜克昆山大学数字创新研究中心) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一个包含音频和振动信号的单速链式输送机数据集,用于多模态工业故障分析,提供标准化评估协议和统一基准以支持通道级分析和多模态融合研究。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06986 2026-03-10 cs.HC cs.CV 79%

ADAS-TO: A Large-Scale Multimodal Naturalistic Dataset and Empirical Characterization of Human Takeovers during ADAS Engagement

ADAS-TO:大规模多模态自然数据集及ADAS参与期间人类接管的实证分析

Yuhang Wang, Yiyao Xu, Jingran Sun, Hao Zhou

机构 * Department of Civil and Environmental Engineering, University of South Florida(土木与环境工程系,佛罗里达州立大学)

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 ADAS-TO数据集通过多模态分析揭示了ADAS参与期间人类接管的运动特征及视觉预警潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13172 2026-03-10 cs.CV 79%

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

WHU-STree: 一个用于街道树盘点的多模态基准数据集

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 WHU-STree是一个多模态的街道树盘点数据集,包含丰富的标注和多任务支持,用于提升城市街道树管理的自动化和智能化水平。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 2026, 233: 519-542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06919 2026-03-10 cs.RO 78%

SurgSync: Time-Synchronized Multi-Modal Data Collection Framework and Dataset for Surgical Robotics

SurgSync: 用于手术机器人的时间同步多模态数据采集框架和数据集

Haoying Zhou, Chang Liu, Yimeng Wu, Junlin Wu, Zijian Wu, Yu Chung Lee, Sara Martuscelli, Spetimiu E. Salcudean, Gregory S. Fischer, Peter Kazanzides

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯特理工学院) Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Robotics and Control Laboratory, the University of British Columbia(机器人与控制实验室,不列颠哥伦比亚大学) Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 SurgSync提出了一种时间同步的多模态数据采集框架和数据集,用于手术机器人中的高阶控制与训练,通过多传感器和后处理工具提升数据质量与实用性。

Comments Accepted By International Conference on Robotics and Automation (ICRA), IEEE, 2026. More details can be found at https://surgsync.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI 76%

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏