arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-30 至 2026-03-30 共收录 72 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2603.26349 2026-03-30 stat.ML cs.AI cs.LG 79%

Generative Score Inference for Multimodal Data

多模态数据生成分数推断

Xinyu Tian, Xiaotong Shen

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出生成分数推断(GSI)框架,通过深度生成模型生成合成样本近似条件分数分布,提升多模态学习中的不确定性量化能力,在大语言模型幻觉检测和图像描述不确定性估计中取得最佳性能。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26015 2026-03-30 cs.CV cs.AI 62%

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

VLAgeBench: 大视觉-语言模型在零样本人类年龄估计中的基准测试

Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

机构 * Begum Rokeya University, Rangpur(贝古姆·罗基亚大学,朗布尔) American International University - Bangladesh(美国国际大学-孟加拉国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAgeBench,评估大视觉-语言模型在零样本人类年龄估计中的性能,展示通用LVLM在无微调情况下表现优异,揭示图像质量和人口子群体差异对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 57%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02898 2026-03-30 cs.CV 57%

One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework

一个补丁即可描述它们全部:一种统一的零样本描述框架

Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi

机构 * ISTI-CNR, Italy(意大利国家研究委员会信息科学与技术研究所) University of Pisa, Italy(比萨大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种统一的零样本描述框架,从图像中心转向补丁中心范式,使能描述任意区域而不需区域级监督。通过将单个补丁视为原子描述单元,实现对任意区域的描述,实验表明有意义的密集视觉特征对多区域描述任务至关重要。

Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: https://paciosoft.com/Patch-ioner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02569 2026-03-30 cs.HC cs.RO 50%

Reframing Human-Robot Interaction Through Extended Reality: Unlocking Safer, Smarter, and More Empathic Interactions with Virtual Robots and Foundation Models

通过扩展现实重新定义人机交互:利用虚拟机器人和基础模型实现更安全、更智能和更具同理心的交互

Yuchong Zhang, Yong Ma, Danica Kragic

机构 * Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习部) Department of Clinical Medicine, University of Bergen(卑尔根大学临床医学系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨通过扩展现实技术,利用基础模型驱动的虚拟机器人实现更安全、智能和具同理心的人机交互,同时讨论多模态大模型在认知和情感交互中的应用及潜在风险。

Comments This paper is under review

Journal ref Empathic Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2603.26113 2026-03-30 cs.MM cs.SD eess.AS 73%

Cinematic Audio Source Separation Using Visual Cues

电影音频源分离使用视觉线索

Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。

Comments CVPR 2026. Project page: https://cass-flowmatching.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26246 2026-03-30 cs.CL cs.AI cs.LG eess.AS 67%

Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR

对话蒸馏:用于基于LLM的ASR的对话音频上下文抽象压缩

Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu, Thibault Bañeras-Roux, Hasindri Watawana, Dairazalia Sanchez-Cortes, Srikanth Madikeri, Petr Motlicek, Andreas Stolcke

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了多模态上下文对基于LLM的ASR的提升效果及高效表示方法,提出抽象压缩技术以减少先前对话的音频负载,实验证明其在领域内和领域外数据集上均有效。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 57%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 10 篇

2603.26033 2026-03-30 cs.CV 83%

Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs

知识即力量:利用大语言模型的多模态语义提升少样本动作识别

Jiazheng Xing, Chao Xu, Hangjie Yuan, Mengmeng Wang, Jun Dan, Hangwei Qian, Yong Liu

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FSAR-LLaVA,首次利用大语言模型作为多模态知识库直接增强少样本动作识别。通过多模态解码器提取时空丰富表示,结合多模态特征增强模块生成视觉和文本特征,并利用MLLM的灵活性设计复合任务导向原型构造,提升跨数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02425 2026-03-30 cs.CV cs.AI cs.CL cs.IR cs.LG 82%

WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

WorldMM: 动态多模态记忆代理用于长视频推理

Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 WorldMM通过构建和检索多种互补记忆,提升长视频推理能力,实现8.4%的性能提升。

Comments CVPR 2026. Project page : https://worldmm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22918 2026-03-30 cs.CV cs.AI cs.CL 75%

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

EVA: 为端到端视频代理的高效强化学习

Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan Duan, Hao Lu, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 EVA通过迭代总结-计划-行动-反思推理实现先规划后感知,提升长视频理解效率,采用三阶段学习流程和高质量数据集,在六个视频理解基准上取得显著提升。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25841 2026-03-30 cs.CV cs.AI 73%

GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding

GazeQwen: 轻量级 gaze-条件 LLM 调制用于流视频理解

Trong Thang Pham, Hien Nguyen, Ngan Le

机构 * University of Arkansas(阿肯色大学) University of Houston(休斯顿大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GazeQwen 通过隐藏状态调制使开源 MLLM 获得 gaze 意识,采用紧凑的 gaze resampler 和可选 LoRA 调整,在 StreamGaze 基准上达到 63.9% 准确率,优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26173 2026-03-30 cs.MM cs.CV cs.GR cs.HC 62%

ComVi: Context-Aware Optimized Comment Display in Video Playback

ComVi:基于上下文的优化评论显示

Minsun Kim, Dawon Lee, Junyong Noh

机构 * KAIST(韩国科学技术院) Kookmin University(国民大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 ComVi通过音频视频相关性计算,将评论映射到相关视频时间点,并优化时间相关性、流行度和显示时长,提升视频观看时的评论体验。

Comments To appear in Proceedings of the ACM CHI Conference on Human Factors in Computing Systems (CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25942 2026-03-30 cs.CV cs.AI 62%

Reinforcing Structured Chain-of-Thought for Video Understanding

强化结构链式思考以提升视频理解

Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu

机构 * Stony Brook University(石溪大学) Amazon(亚马逊)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SDRL框架,通过结构化链式思考格式和自监督机制,解决多模态大语言模型在视频理解中的推理漂移和时间感知问题,实现单阶段强化学习,提升模型泛化能力。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV 57%

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26365 2026-03-30 cs.CV 57%

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

通过强化学习实现高效的视频理解动态令牌压缩

Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SCORE框架,通过强化学习学习自适应令牌压缩策略,有效解决视频理解中的计算成本和上下文旋转问题,实现16倍的预填充加速且性能损失仅0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26245 2026-03-30 cs.CE cs.AI 57%

Physics-Informed Neural Networks and Sequence Encoder: Application to heating and early cooling of thermo-stamping process

具有物理信息神经网络和序列编码器的方法:应用于热成形过程的加热和早期冷却

Mouad Elaarabi, Domenico Borzacchiello, Philippe Le Bot, Nathan Lauzeral, Sebastien Comas-Cardona

机构 * Nantes Université, Ecole Centrale Nantes, CNRS, GeM, UMR 6183(南特大学、中央南特理工学院、法国国家科学研究中心、GeM实验室、UMR 6183)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了将PINN-SE应用于更现实的热成形过程加热和早期冷却问题,探索了多模态数据输入和变几何场景的可能性,并展示了基于合成数据训练模型在真实数据上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15812 2026-03-30 cs.CV 57%

ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation

ModTrack:通过身份感知的PHD滤波与协方差传播实现传感器无关的多视角跟踪

Aditya Iyer, Jack Roberts, Nora Ayanian

机构 * Brown University(布朗大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 ModTrack通过身份感知的PHD滤波与协方差传播实现多视角多目标跟踪,提供跨模态、传感器无关的泛化能力及可追溯的不确定性。系统将学习限制在检测和特征提取阶段,利用闭式分析方法进行融合、关联和跟踪,实现95.5 IDF1和91.4 MOTA的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2603.26341 2026-03-30 cs.CV 70%

HINT: Composed Image Retrieval with Dual-path Compositional Contextualized Network

HINT: 基于双路径组合上下文化网络的复合图像检索

Mingyu Zhang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Jiajia Nie, Yinwei Wei, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HINT模型,通过双路径组合上下文化网络增强匹配与非匹配样本的相似度差异,提升复杂场景下复合图像检索性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25891 2026-03-30 cs.CV 70%

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

少样本文本到图像检索:新基准数据集和优化方法

Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出FSIR任务及FSIR-BD数据集,通过少样本学习方法提升图像检索性能,实验表明其基准挑战性及优化方法优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2603.25752 2026-03-30 cs.CL cs.SD eess.AS 84%

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。

Comments 19 pages

Journal ref neurocomputing2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22687 2026-03-30 cs.CV 83%

GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

GeoTikzBridge:推动多模态代码生成在几何感知与推理中的发展

Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen, Yi Zhang, Errui Ding, Liang Li, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(九天研究院)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GeoTikzBridge框架,通过基于tikz的代码生成提升局部几何感知和视觉推理能力,利用两个互补数据集训练模型,实现多模态大语言模型在几何问题解决中的先进性能。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26348 2026-03-30 cs.CV cs.AI 81%

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15702 2026-03-30 cs.IT cs.CV cs.NI math.IT 79%

Editable-DeepSC: Reliable Cross-Modal Semantic Communications for Facial Editing

可编辑的深度语义通信:面向面部编辑的可靠跨模态语义通信

Bin Chen, Wenbo Yu, Qinshan Zhang, Tianqu Zhuang, Hao Wu, Yong Jiang, Shu-Tao Xia

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Editable-DeepSC,一种用于面部编辑的跨模态语义通信方法,通过联合编辑-信道编码和SNR感知信道编码,提升传输效率与编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 62%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 57%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 57%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26466 2026-03-30 cs.RO 50%

Adapt as You Say: Online Interactive Bimanual Skill Adaptation via Human Language Feedback

根据指令适应:通过人类语言反馈实现在线交互双臂技能适应

Zhuo Li, Dianxi Li, Tao Teng, Quentin Rouxel, Zhipeng Dong, Dennis Hong, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学T-Stone机器人研究所协作与多功能机器人(CLOVER)实验室) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系) Department of Advanced Robotics, Istituto Italiano di Tecnologia(意大利技术研究院先进机器人系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出BiSAIL框架,通过交互语言反馈实现零样本在线适应,提升双臂技能在任务变化中的适应性、泛化能力和跨身体可扩展性。

Comments 11 pages, 15 figures, submitted to IEEE TMECH

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22886 2026-03-30 cs.LG cs.RO 50%

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

任务标记:一种灵活的适应行为基础模型的方法

Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler

机构 * Technion(以色列理工学院) NVIDIA Research(英伟达研究院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出任务标记方法,通过强化学习学习任务特定编码器,使行为基础模型适应特定任务,同时保持灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 21 篇

2603.16629 2026-03-30 cs.CV cs.AI 84%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏