arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-12 至 2026-03-12 共收录 52 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2603.10335 2026-03-12 cs.CV 79%

Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models

Fuel Gauge: 在大型多模态模型中提前估计链式推理长度

Yuedong Yang, Xiwen Wei, Mustafa Munir, Radu Marculescu

机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电气与计算机工程系)

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV

AI总结 Fuel Gauge通过提取隐藏信号提前预测链式推理长度,有效解决LMMs中的内存碎片化和推理效率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17066 2026-03-12 cs.AI cs.CL cs.CV cs.LG cs.MA 67%

Mindstorms in Natural Language-Based Societies of Mind

自然语言基础的思维社会中的风暴

Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。

Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices

Journal ref (2025). Computational Visual Media, 11(1), 29-81

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10549 2026-03-12 cs.CV cs.AI eess.SP 62%

Towards Cognitive Defect Analysis in Active Infrared Thermography with Vision-Text Cues

面向主动红外热成像的认知缺陷分析:结合视觉-文本线索

Mohammed Salah, Eman Ouda, Giuseppe Dell'Avvocato, Fabrizio Sarasini, Ester D'Accardi, Jorge Dias, Davor Svetinovic, Stefano Sfarra, Yusra Abdulrahman

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种结合视觉-文本线索的主动红外热成像认知缺陷分析框架,利用预训练多模态模型实现零样本缺陷检测,实验显示其信噪比提升超过10dB,交并比达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09771 2026-03-12 cs.CV cs.AI 62%

Ego: Embedding-Guided Personalization of Vision-Language Models

Ego:基于嵌入的视觉-语言模型个性化

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI 62%

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10436 2026-03-12 cs.RO cs.DC 50%

COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints

COHORT: 基于混合强化学习的多机器人系统实时协同大规模深度神经网络推理

Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

专题命中 图文多模态 :multimodal(abstract)

AI总结 COHORT通过混合强化学习策略,优化多机器人系统在实时约束下的大规模DNN推理,降低能耗并提升GPU利用率。

Comments Recently accepted at 27th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks ( IEEE WoWMoM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10158 2026-03-12 cs.RO 50%

Cross-Hand Latent Representation for Vision-Language-Action Models

跨手的潜在表示用于视觉-语言-动作模型

Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

专题命中 图文多模态 :multimodal(abstract)

AI总结 XL-VLA通过统一的潜在动作空间实现跨手灵巧操作的可扩展学习,提升视觉-语言-动作模型的训练效率和性能。

Comments Website: https://xl-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2505.17862 2026-03-12 cs.AI cs.CL cs.CV 87%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12583 2026-03-12 eess.AS cs.SD 83%

Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion

鲁棒的音频视觉目标说话人提取与情感感知多注册融合

Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li

机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS

AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10043 2026-03-12 cs.MM cs.AI cs.SD 81%

AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition

AMB-DSGDN: 适应性模态平衡动态语义图差分网络用于多模态情感识别

Yunsheng Wang, Yuntao Shou, Yilong Tan, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南林业科技大学) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 AMB-DSGDN通过适应性模态平衡和动态语义图差分机制,提升多模态情感识别的准确性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10465 2026-03-12 cs.SD cs.CV cs.HC 79%

MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR

MoXaRt: 基于音频视觉对象的XR声音交互

Tianyu Xu, Sieun Kim, Qianhui Zheng, Ruoyu Xu, Tejasvi Ravi, Anuva Kulkarni, Katrina Passarella-Ward, Junyi Zhu, Adarsh Kowdle

机构 * Google Mountain View CA USA(谷歌山景城) University of Michigan Ann Arbor MI USA(密歇根大学安 Arbor分校) Columbia University New York NY USA(哥伦比亚大学) Google San Francisco CA USA(谷歌旧金山)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 MoXaRt通过音频视觉线索分离交织声源,提升XR环境中的语音可懂度和社交参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23610 2026-03-12 cs.SD cs.CV 79%

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

高效音频-视觉语音分离与离散唇语语义及多尺度全局-局部注意力

Kai Li, Kejun Gao, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist,清华大学,北京) IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing(IDG/麦克戈文脑研究 institute,清华大学,北京) Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院(CIBR),北京)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 Dolphin通过离散唇语语义和多尺度全局-局部注意力实现高效音频-视觉语音分离,提升分离质量和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07696 2026-03-12 eess.AS 57%

Multi-View Based Audio Visual Target Speaker Extraction

基于多视角的音频视觉目标说话人提取

Peijun Yang, Zhan Jin, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出多视角张量融合框架,通过多视角学习提升音频视觉目标说话人提取的性能与鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03542 2026-03-12 cs.CV 57%

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音到LaTeX:用于将语音方程和句子转换为LaTeX的新模型和数据集

Dmitrii Korzh, Dmitrii Tarasov, Artyom Iudin, Elvir Karimov, Matvey Skripkin, Nikita Kuzmin, Andrey Kuznetsov, Oleg Y. Rogov, Ivan Oseledets

机构 * AXXX MTUCI(莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) HSE University(俄罗斯高等经济大学) Applied AI Institute(应用人工智能研究所) Innopolis University(Innopolis大学) Moscow State University(莫斯科国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个开源大规模数据集和模型,用于将语音中的数学方程和句子转换为LaTeX,显著提升了转换精度。

Comments 22 pages, 2 figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 50%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2401.16685 2026-03-12 cs.LG cs.DC 78%

Communication-Efficient Multimodal Federated Learning: Joint Modality and Client Selection

高效多模态联邦学习:联合模态与客户端选择

Liangqi Yuan, Dong-Jun Han, Su Wang, Devesh Upadhyay, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) School of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程学院) Saab Inc.(Saab公司)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MFedMC框架,通过解耦架构和联合选择算法,实现高效多模态联邦学习,减少通信开销并提升模型泛化能力。

Comments arXiv admin note: text overlap with arXiv:2310.07048

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 62%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10089 2026-03-12 stat.ME stat.AP 50%

Trajectory-informed graph-based clustering for longitudinal cancer subtyping

基于轨迹的图基团分析用于纵向癌症亚型分类

Lara Cavinato, Marco Rocchi, Luca Viganò, Francesca Ieva

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于轨迹的图聚类方法,用于纵向癌症亚型分类,整合多模态临床数据和患者轨迹,以发现具有不同预后轨迹的亚型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2602.04268 2026-03-12 cs.CV 79%

KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing

KVSmooth: 通过键值平滑缓解多模态大语言模型中的幻觉

Siyu Jiang, Feiyang Chen, Xiaojin Zhang, Kun He

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 KVSmooth通过键值平滑技术有效缓解多模态大语言模型中的幻觉问题,提升生成精度和召回率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22427 2026-03-12 cs.CR cs.AI 57%

Adversarial Hubness Detector: Detecting Hubness Poisoning in Retrieval-Augmented Generation Systems

对抗性中心性检测器:在检索增强生成系统中检测中心性污染

Idan Habler, Vineeth Sai Narajala, Stav Koren, Amy Chang, Tiffany Saade

机构 * Idan Habler Vineeth Sai Narajala Stav Koren Amy Chang Tiffany Saade

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 Hubscan通过多检测器架构检测RAG系统中的对抗性中心性问题,利用统计分析、聚类扩展、稳定性测试和领域感知方法,有效识别并隔离潜在的安全威胁。

Comments 11 pages, 5 figures, 2 tables, Github: https://github.com/cisco-ai-defense/adversarial-hubness-detector, Updated with minor changes to naming

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2602.14178 2026-03-12 cs.CV cs.AI 84%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10343 2026-03-12 eess.SP 82%

Multi-Modal Intelligent Channel Modeling: From Fine-tuned LLMs to Pre-trained Foundation Models

多模态智能信道建模:从微调大语言模型到预训练基础模型

Lu Bai, Zengrui Han, Mingran Sun, Xiang Cheng

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10702 2026-03-12 cs.CV 79%

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations

UniCom: 通过压缩的连续语义表示实现统一多模态建模

Yaqi Zhao, Wang Lin, Zijian Zhang, Miles Yang, Jingyuan Chen, Wentao Zhang, Zhao Zhong, Liefeng Bo

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09394 2026-03-12 cs.HC 78%

EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology

EyeAgent:一种用于眼科多模态临床决策支持的智能AI系统

Danli Shi, Xiaolan Chen, Bingjie Yan, Weiyi Zhang, Pusheng Xu, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Bowen Liu, Xinyuan Wu, Meng Xie, Ziyu Gao, Yue Wu, Senlin Lin, Kai Jin, Xia Gong, Yih Chung Tham, Xiujuan Zhang, Li Dong, Yuzhou Zhang, Jason Yam, Guangming Jin, Xiaohu Ding, Haidong Zou, Yalin Zheng, Zongyuan Ge, Mingguang He

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 EyeAgent通过整合53种眼科工具提升诊断准确率,实现多模态临床决策支持,为眼科AI系统提供新范式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10519 2026-03-12 cs.CV 57%

Visually-Guided Controllable Medical Image Generation via Fine-Grained Semantic Disentanglement

通过细粒度语义解耦实现视觉引导的可控医学图像生成

Xin Huang, Junjie Liang, Qingshan Hou, Peng Cao, Jinzhu Yang, Xiaoli Liu, Osmar R. Zaiane

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,中国沈阳) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,中国沈阳) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,中国沈阳) AiShiWeiLai AI Research, China(艾世维来人工智能研究,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学艾米人工智能研究所,加拿大埃德蒙顿,阿尔伯塔)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出视觉引导的文本解耦框架,通过细粒度语义解耦提升医学图像生成的可控性和生成质量。

Comments 10 pages, 7 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10470 2026-03-12 cs.CV 57%

Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制

Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini

机构 * York University(约克大学) Macquarie University(麦考瑞大学) Northern Illinois University(北伊利诺伊大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01957 2026-03-12 cs.CV 57%

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉

Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10980 2026-03-12 cs.RO 50%

PPGuide: Steering Diffusion Policies with Performance Predictive Guidance

PPGuide: 通过性能预测引导操控扩散策略

Zixing Wang, Devesh K. Jha, Ahmed H. Qureshi, Diego Romeres

专题命中 多模态生成 :multi-modal(abstract)

AI总结 PPGuide通过性能预测引导技术,在推理时引导预训练的扩散策略避免失败模式,提升机器人操作的鲁棒性。

Comments Accepted by ICRA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25622 2026-03-12 cs.IR 50%

Taming the Long Tail: Denoising Collaborative Information for Robust Semantic ID Generation

驯服长尾:去噪协作信息以实现稳健的语义ID生成

Yi Xu, Moyu Zhang, Chaofan Fan, Jinxin Hu, Xiaochen Li, Yu Zhang, Xiaoyi Zeng, Jing Zhang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出ADC-SID框架,通过自适应去噪协作信息提升语义ID生成的稳健性,解决行为-内容对齐和行为权重分配中的噪声问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 7 篇

2509.23499 2026-03-12 cs.CV cs.CL cs.LG 82%

Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional

多模态数据光谱:多模态数据集是多维的

Divyam Madaan, Varshan Muhunthan, Kyunghyun Cho, Sumit Chopra

机构 * New York University(纽约大学) GenentechCIFAR(基因泰克CIFAR) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL;multimodal(comments)

AI总结 本文通过多模态大语言模型分析23个视觉问答基准,揭示了不同模态在目标任务中的依赖性差异,发现部分基准因设计缺陷放大了图像依赖性。

Comments Accepted to ICLR 2026. Code available at https://github.com/divyam3897/multimodal-spectrum

详情

展开后加载摘要…

URL PDF HTML 收藏