arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2603.02663 2026-03-04 cs.CL cs.CV 90%

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

利用多模态项目反应理论评估跨模态推理能力与问题特征

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi

机构 * Kyoto University(京都大学) CyberAgent The Institute of Statistical Mathematics(统计数学研究所) Tohoku University(东北大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 M3IRT通过分解模型能力和项目难度,提供了一种评估多模态推理能力的框架,有效提升基准测试的可靠性和质量。

Comments 24pages, 20 figures, accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02609 2026-03-04 cs.CV cs.RO 79%

VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction

VLMFusionOcc3D: 基于VLM的多模态3D语义占位预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥克辛大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 VLMFusionOcc3D通过融合视觉语言模型的语义先验,提升多模态3D语义占位预测的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18362 2026-03-04 cs.SE cs.CL cs.CV 76%

WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development

WAFFLE:针对自动化前端开发的多模态模型微调

Shanchao Liang, Nan Jiang, Shangshu Qian, Lin Tan

机构 * Purdue University(普渡大学)

专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 WAFFLE通过结构感知注意力机制和对比微调方法,提升多模态模型在UI到HTML代码生成中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02557 2026-03-04 cs.CV cs.AI 62%

CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment

CAPT:基于混淆的提示微调以减少视觉-语言不一致

Maoyuan Shao, Yutong Gao, Xinyang Huang, Chuang Zhu, Lijuan Sun, Guoshun Nan

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Library of China, Beijing, China(中国国家图书馆) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13315 2026-03-04 cs.CV cs.AI 62%

Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models

Self-Aug: 用于大视觉-语言模型的查询和熵自适应解码

Eun Woo Im, Muhammad Kashif Ali, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Self-Aug,一种无需训练的解码策略,通过自增强提示和自适应阈值算法提升大视觉-语言模型的事实一致性。

Comments 10 pages, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02959 2026-03-04 cs.CV 57%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2602.21646 2026-03-04 cs.CL 85%

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

可扩展的多语言多模态机器翻译与语音-文本融合

Yexing Du, Youcheng Pan, Zekun Wang, Zheng Chu, Yichong Huang, Kaiyuan Liu, Bo Yang, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL

AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02877 2026-03-04 eess.AS 83%

DBMIF: a deep balanced multimodal iterative fusion framework for air- and bone-conduction speech enhancement

DBMIF:一种用于空气传导和骨传导语音增强的深度平衡多模态迭代融合框架

Yilei Wu, Changyan Zheng, Xingyu Zhang, Yakun Zhang, Chengshi Zheng, Shuang Yang, Ye Yan, Erwei Yin

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 eess.AS

AI总结 DBMIF通过深度平衡多模态迭代融合框架提升空气传导和骨传导语音增强性能,降低字符错误率2.5%以上。

Comments 10 pages, 7 figures, Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03060 2026-03-04 eess.IV eess.AS 79%

DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming

DLIOS:一种增强现实时间多模态交互增强叠加系统的大型语言模型增强系统,用于抖音直播

Shuide Wen, Sungil Seok, Beier Ku, Richee Li, Yubin He, Bowen Qu, Yang Yang, Ping Su, Can Jiao

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

AI总结 DLIOS通过LLM增强实时多模态交互增强系统,实现抖音直播中的弹幕、礼物效果和TTS广播的高效处理与优化。

Comments 14 pages, 13 figures, 6 tables, 7 algorithms, 16 references, submitted to ACM/IEEE International Conference on Systems and Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11536 2026-03-04 physics.flu-dyn 78%

Multimodal nonlinear acoustics in two- and three-dimensional curved ducts

二维和三维弯曲管道中的多模非线性声学

Freddie Jensen, Edward James Brambley

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文提出了一种用于二维和三维弯曲管道中弱非线性声学的模型,通过多模方法和张量卷积提高了数值效率,并展示了多种声学特性及应用潜力。

Comments 55 pages, 17 figures, supplementary material available from https://ejbrambley.warwick.ac.uk/publications.html

Journal ref J. Fluid Mech. 1030 (2026) A19

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12386 2026-03-04 cs.HC 50%

Hey Dashboard!: Supporting Voice, Text, and Pointing Modalities in Dashboard Onboarding

Hey Dashboard!:在仪表盘引导中支持语音、文本和指向模态

Vaishali Dhanoa, Gabriela Molina León, Eve Hoggan, Eduard Gröller, Marc Streit, Niklas Elmqvist

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 DIANA通过语音、文本和指向等多种模态,为仪表盘引导提供自助导航和分析支持,提升用户在复杂仪表盘中的使用效率。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2505.19892 2026-03-04 cs.AI 83%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02390 2026-03-04 cs.CV eess.SP 83%

OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments

OpenMarcie:工业环境中的多模态动作识别数据集

Hymalai Bello, Lala Ray, Joanna Sorysz, Sungho Suh, Paul Lukowicz

机构 * DFKI Kaiserslautern(DFKI凯撒斯劳滕) RPTU Kaiserslautern-Landau(RPTU凯撒斯劳滕-兰道) Korea University(韩国大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OpenMarcie是首个大规模多模态数据集,用于工业环境中的动作识别,包含36名参与者在不同任务中的多模态数据,支持活动分类、开放词汇描述和跨模态对齐任务。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI 81%

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02481 2026-03-04 cs.CV 79%

ModalPatch: A Plug-and-Play Module for Robust Multi-Modal 3D Object Detection under Modality Drop

ModalPatch: 一种插拔式模块,用于在模态缺失情况下鲁棒的多模态3D目标检测

Shuangzhi Li, Lei Ma, Xingyu Li

机构 * University of Alberta, Canada(阿尔伯塔大学) The University of Tokyo, Japan(东京大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 ModalPatch是一种插拔式模块,通过利用传感器数据的时间特性实现感知连续性,提升多模态3D目标检测在模态缺失情况下的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02569 2026-03-04 cs.HC 78%

An LLM-Assisted Toolkit for Inspectable Multimodal Emotion Data Annotation

一种辅助多模态情绪数据标注的工具包

Zheyuan Kuang, Weiwei Jiang, Nicholas Koemel, Matthew Ahmadi, Emmanuel Stamatakis, Benjamin Tag, Anusha Withana, Zhanna Sarsenbayeva

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种LLM辅助的多模态情绪数据标注工具包,通过可检查的工作流实现细粒度标注,提升跨模态一致性检查效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02546 2026-03-04 cs.CV 70%

On Discriminative vs. Generative classifiers: Rethinking MLLMs for Action Understanding

在判别与生成分类器之间:重新思考MLLMs用于动作理解

Zhanzhong Pang, Dibyadip Chatterjee, Fadime Sener, Angela Yao

机构 * National University of Singapore(国立新加坡大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GAD分类器,通过生成辅助判别方法提升封闭集动作理解的准确性和效率,达到SOTA效果。

Comments 22 pages, 9 figures, 16 tables. Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18833 2026-03-04 cs.SD cs.CV eess.AS eess.IV 62%

PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation

PrismAudio:分解的思维链与多维奖励用于视频到音频生成

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Peiwen Sun, Rongjie Huang, Xiangang Li, Jieping Ye, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) The Chinese University of Hong Kong (CUHK)(香港中文大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 PrismAudio通过分解思维链与多维奖励,解决视频到音频生成中的目标纠缠问题,实现更高质量的生成效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02470 2026-03-04 cs.IT cs.LG cs.MM eess.IV math.IT 57%

Video TokenCom: Textual Intent-Guided Multi-Rate Video Token Communications with UEP-Based Adaptive Source-Channel Coding

视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信

Jingxuan Men, Mahdi Boloursaz Mashhadi, Ning Wang, Yi Ma, Mike Nilsson, Rahim Tafazolli

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01412 2026-03-04 cs.CV 57%

UETrack: A Unified and Efficient Framework for Single Object Tracking

UETrack: 一种高效的单目标跟踪统一框架

Ben Kang, Jie Zhao, Xin Chen, Wanting Geng, Bin Zhang, Lu Zhang, Dong Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UETrack提出了一种高效的单目标跟踪框架,通过令牌池混合机制和目标感知蒸馏策略,实现多模态场景下的高效跟踪性能。

Comments This paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2603.02329 2026-03-04 cs.CV 89%

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER: 通过跨模态整合利用大语言模型进行意图驱动的3D affordance grounding

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 跨模态检索 :MLLM(title,abstract);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 HAMMER通过跨模态整合多模态大语言模型,实现意图驱动的3D affordance grounding,提升3D表示的准确性和鲁棒性。

Comments Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02695 2026-03-04 cs.LG 78%

Addressing Missing and Noisy Modalities in One Solution: Unified Modality-Quality Framework for Low-quality Multimodal Data

解决缺失和噪声模态:统一的模态质量框架用于低质量多模态数据

Sijie Mai, Shiqin Han, Haifeng Hu

机构 * Department of Computer Science(计算机科学系) South China Normal University(华南师范大学) School of Electronics and Information Technology(电子与信息学院) Sun Yat-sen University(中山大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出统一的模态质量框架,通过联合处理缺失和噪声模态,提升低质量多模态数据的模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02434 2026-03-04 cs.CV cs.AI 73%

MIRAGE: Knowledge Graph-Guided Cross-Cohort MRI Synthesis for Alzheimer's Disease Prediction

MIRAGE:基于知识图谱的跨群体MRI合成用于阿尔茨海默病预测

Guanchen Wu, Zhe Huang, Yuzhang Xie, Runze Yan, Akul Chopra, Deqiang Qiu, Xiao Hu, Fei Wang, Carl Yang

机构 * Emory University, Atlanta, USA(埃默里大学) Cornell University, New York, USA(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MIRAGE通过知识图谱引导的跨群体MRI合成,提升无真实MRI群体中阿尔茨海默病的诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02556 2026-03-04 cs.CV cs.AI cs.CL cs.LG 67%

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

通过对比的视角:VLMs中的自改进视觉推理

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Cloud(阿里云)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。

Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17558 2026-03-04 cs.CL 57%

A Survey of Query Optimization in Large Language Models

大型语言模型中查询优化的综述

Mingyang Song, Mao Zheng

机构 * Large Language Model Department(大语言模型部门)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型中查询优化的技术,提出查询优化生命周期框架、查询复杂度分类法及四个基本操作,分析了优化方法和挑战,为研究和实践提供指导。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2510.00438 2026-03-04 cs.CV 85%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02273 2026-03-04 cs.LG 82%

Graph Attention Based Prioritization of Disease Responsible Genes from Multimodal Alzheimer's Network

基于图注意力的多模态阿尔茨海默病相关基因优先级排序

Binon Teji, Subhajit Bandyopadhyay, Swarup Roy

机构 * Network Reconstruction & Analysis Lab and Department of Computer Applications, Sikkim University(网络重建与分析实验室和计算机应用系,西西米大学) Network Reconstruction & Analysis Lab, Department of Computer Applications, Sikkim University(网络重建与分析实验室,计算机应用系,西西米大学) Department of Computer Science & Engineering, Tezpur University(计算机科学与工程系,泰朱大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 NETRA通过多模态图变换器框架,利用注意力机制优先排序阿尔茨海默病相关基因,显著提升疾病通路富集分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL 79%

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26127 2026-03-04 cs.CV 57%

EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model

EchoGen: 通过前馈主体驱动自回归模型在任意场景中生成视觉回声

Ruixiao Dong, Zhendong Wang, Keli Liu, Li Li, Ying Chen, Kai Li, Daowen Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 EchoGen通过前馈主体驱动自回归模型在任意场景中生成高质量视觉回声,实现高效生成与高保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02778 2026-03-04 cond-mat.mtrl-sci 50%

Unlocking the Potential of Ni2+ and Ni2+-Cr3+ Synergy for Bifunctional Pressure and Temperature Optical Sensing

解锁Ni²+和Ni²⁺-Cr³+协同作用在双功能压力和温度光学传感中的潜力

M. Szymczak, L. Marciniak

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过Ni²+和Cr³+协同发光实现高灵敏度双功能压力温度传感,首次展示其在近红外测压中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏