arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 122 篇

2608.08235 2026-08-14 eess.AS 版本更新 57%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新 57%

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01982 2026-08-12 cs.HC cs.AI 版本更新 57%

Music Interpretation and Emotion Perception: A Computational and Neurophysiological Investigation

音乐诠释与情感感知:计算与神经生理学调查

Vassilis Lyberatos, Spyridon Kantarelis, Ioanna Zioga, Christina Anagnostopoulou, Giorgos Stamou, Anastasia Georgaki

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(电气与计算机工程学院,国家技术大学雅典) Department of Music Studies, National and Kapodistrian University of Athens(音乐研究系,国家与卡波迪斯特里亚大学雅典)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用计算和神经生理学方法,探究不同演奏情境(如曲目、调式练习曲和即兴演奏)及表现力水平对表演者情感传达和听众反应的影响,发现表现力和即兴演奏具有独特声学特征并引发更强情感反应,且即兴演奏带来更大的神经生理放松。

Comments Accepted at SMC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22790 2026-08-11 cs.SD cs.AI 版本更新 57%

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

高效扩展音频模型:计算约束与优化行为的联合研究

Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu

机构 * University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 57%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31589 2026-08-10 cs.CV 版本更新 57%

Recognizing Co-Speech Gestures in-the-Wild

识别野外伴随语音的手势

Sindhu B Hegde, K R Prajwal, Andrew Zisserman

机构 * Visual Geometry Group, Dept. of Engineering Science, University of Oxford(视觉几何组,工程科学系,牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对当前多模态模型难以捕捉语义性伴随手势的问题,构建了首个大规模基准数据集GRW,用于训练视频模型进行手势语义分类、对应词汇识别和时序定位。

Journal ref European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06612 2026-08-07 cs.CV 版本更新 57%

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

从音频到视频的桥梁:音素-视素对齐让任意人脸可说多种语言

Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出MuEx框架,通过PG-MoE架构和PV-Align机制,结合含12种语言的MTFD数据集,实现多语言语音驱动说话人脸合成,在MTFD全语言表现优异且可零样本泛化到未见语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15755 2026-08-03 cs.SD cs.AI 版本更新 57%

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

AuEmoChat:用于对话语音合成的真实情感理解与呈现

Zhenqi Jia, Yuan Zhao, Aruukhan, Rui Liu, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07044 2026-07-30 cs.DB cs.AI cs.CR 版本更新 57%

Balancing Privacy and Efficiency: Music Information Retrieval via Additive Homomorphic Encryption

平衡隐私与效率:基于加法同态加密的音乐信息检索

William Zerong Wang, Dongfang Zhao

机构 * University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出基于加法同态加密的音乐检索方法,实现音乐专用推理攻击量化、结构感知加法原语优化,在四组音频数据集上验证其兼具隐私性与高效扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18946 2026-07-29 cs.CL 版本更新 57%

Constrained CTC Decoding for Efficient Diacritic Restoration

用于高效变音符恢复的约束 CTC 解码

Rufael Marew, Amr Keleg, Hanan Aldarmaki

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 研究阿拉伯语音转录本变音符恢复问题,提出基于 CTC 的高效非自回归方法,通过构建标注格并纳入硬约束进行解码,在相关测试集上评估,相比基线降低了变音符错误率,实现性能和效率提升。

Comments Accepted at Interspeech 2026. Includes an additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20541 2026-07-28 cs.CL cs.CY 版本更新 57%

SAFE-MEME: Structured Reasoning Framework for Robust Hate Speech Detection in Memes

SAFE-MEME:用于表情包中鲁棒性仇恨言论检测的结构化推理框架

Palash Nandi, Shivam Sharma, Tanmoy Chakraborty

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究表情包中仇恨言论检测难题,提出SAFE-MEME框架及其两个变体,通过构建新型数据集进行基准测试,实验表明SAFE-MEME-QA和SAFE-MEME-H能有效检测仇恨言论,且不同方法在常规和混淆场景各有优势,还分析了错误案例。

Comments 44 pages, 27 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28022 2026-07-14 cs.CV 版本更新 57%

Are DeepFakes Realistic Enough? Exploring Semantic Mismatch as a Novel Challenge

深度伪造是否足够逼真?探索语义不匹配作为新的挑战

Sharayu Nilesh Deshmukh, Kailash A. Hambarde, Joana C. Costa, Hugo Proença, Tiago Roxo

机构 * Instituto de Telecomunicações, Universidade da Beira Interior(电信研究所,贝拉内里大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出新的评估框架,通过引入语义不匹配类别,评估现有模型在面对语义不一致的深度伪造数据时的鲁棒性,并提出语义强化策略提升检测性能。

Comments Added missing FGI results in semantic reinforcement eval (Table 9), showing an architecture-dependent effect. Abstract, contributions, and conclusion revised accordingly. Clarified RARV-SMM/semantic mismatch definition. Corrected SOTA comparison claim (Sec. 4.7). Added code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12527 2026-07-07 eess.AS 版本更新 57%

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

Audio-Cogito:迈向大型音频语言模型中的深度音频推理

Longhao Li, Hongjie Chen, Zehan Li, Qihan Hu, Jian Kang, Jie Li, Lei Xie, Yongxiang Li

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Audio-Cogito,通过开发Cogito-pipe数据集和自蒸馏策略,提升音频推理能力,在MMAR基准和Interspeech 2026挑战中表现优异。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08660 2026-06-26 cs.CL 版本更新 57%

A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

预训练语言模型时代语义角色标注的系统综述

Huiyao Chen, Meishan Zhang, Jing Li, Lilja Øvrelid, Jan Hajič, Hao Fei, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳南山区研究院) University of Oslo(奥斯陆大学) Charles University(查尔斯大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出四维分类法系统综述SRL研究,分析句法特征的作用条件,首次系统处理大语言模型时代的SRL,并扩展至多模态设置。

Comments 54 pages, 9 figures, 9 tables. Accepted at Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06080 2026-06-26 cs.CV cs.CY cs.HC 版本更新 57%

AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired

AIDEN:面向视障人士的AI助手设计与初步研究

Luis Marquez-Carpintero, Francisco Gomez-Donoso, Zuria Bauer, Bessie Dominguez-Dager, Alvaro Belmonte-Baeza, Mónica Pina-Navarro, Francisco Morillas-Espejo, Felix Escalona, Miguel Cazorla

机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。

Journal ref IEEE Access 14 (2026) 80406-80420

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04109 2026-06-25 cs.HC cs.AI 版本更新 57%

Tinker Tales: A Tangible Dialogue System for Child-AI Co-Creative Storytelling

Tinker Tales:一个用于儿童与AI共同创意故事讲述的有形对话系统

Nayoung Choi, Jiseung Hong, Peace Cyebukayire, Ikseon Choi, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) School of Nursing, Emory University(埃默里大学护理学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Tinker Tales有形对话系统,通过结合物理故事板、NFC玩具和移动应用,支持儿童与AI在四个叙事阶段进行协作故事创作,并发现提示框架影响儿童叙事贡献的形式和一致性。

Comments Accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18726 2026-06-19 cs.SD cs.LG eess.AS 版本更新 57%

Bioacoustic Geolocation: Species Sounds as Geographic Signals

生物声学地理定位:物种声音作为地理信号

Mustafa Chasmai, Wuao Liu, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究仅通过声音进行全球尺度地理定位,利用生物声学信号中的物种地理分布线索,提出结合物种范围预测与检索的地理定位方法,并验证多模态融合的潜力。

Comments Accepted to ICML 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26672 2026-06-18 cs.MM cs.SD 版本更新 57%

Can We Hear from Events? Generating Speech from Event Camera

我们能从事件中听到声音吗?从事件相机生成语音

Jingping Fang, Lin Chen, Chenyang Xu, Tong Zhao, Weidong Cai, Xiaoming Chen

机构 * Beijing Technology and Business University(北京技术与商业大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Sydney(悉尼大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 提出EventSpeech框架,利用神经形态事件相机的高时间精度解决传统RGB语音生成中的时间粒度不匹配问题,实现情感丰富且抗运动模糊的语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22363 2026-06-18 cs.LG eess.AS 版本更新 57%

Investigating Faithfulness in Large Audio Language Models

大型音频语言模型中的忠实性研究

Pooneh Mousavi, Lovenya Jain, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(康科迪亚大学) Mila - Quebec AI Institute(魁北克人工智能研究院) Université Laval(拉瓦尔大学) Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,皮兰尼)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出系统框架评估大型音频语言模型在推理链忠实性上的表现,定义三个音频忠实性标准,并通过基准测试发现模型推理与音频输入存在脱节。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01157 2026-06-11 cs.CL cs.CR cs.SD 版本更新 57%

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

后门藏身何处?语音语言模型中后门传播的组件级分析

Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) École de technologie supérieure(高等技术学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过后门攻击视角,对语音语言模型进行组件级分析,揭示后门在不同组件中的传播机制,发现后门持久性高度依赖目标组件,且中毒样本与良性样本在共享嵌入中不可直接分离。

Comments Interspeech 2026 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08384 2026-06-09 cs.CL 版本更新 57%

jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入

Florian Hönicke, Michael Günther, Andreas Koukounas, Mohammad Kalim Akram, Scott Martens, Saba Sturua, Han Xiao

机构 * Jina by Elastic(Jina 由 Elastic 公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。

Comments 11 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22793 2026-06-09 cs.AI 版本更新 57%

Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI

信号不是状态:面向文化意识课堂AI的神经符号安全机制

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出NSCR框架,通过神经符号方法处理课堂多模态信号,区分可观测证据与文化负载解读,减少文化偏见对课堂AI的负面影响。

Comments Accepted at the Workshop on Stereotypes Across Cultures in Language Technologies @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02916 2026-08-17 cs.SD cs.LG 版本更新 50%

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

SALSA-V:基于视频的捷径增强式长同步音频生成模型

Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01920 2026-08-05 cs.SD 版本更新 50%

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

P-MUSE:用于统一器乐合成与编辑的提示-MIDI可选模型

Chong Jing, Junan Zhang, Jing Yang, Yulun Wu, Fan Fan, Zhizheng Wu

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 P-MUSE是统一器乐合成与编辑的MIDI-to-Music框架,通过多阶段课程学习整合两种生成范式,提出相位感知引导策略与尾端丢弃法,并建立含四类乐器的综合基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19605 2026-07-24 cs.SD 版本更新 50%

RIME: Enabling Large-Scale Agentic Music Post-Production

RIME:实现大规模智能后期制作

Noah Schaffer, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对音乐后期制作问题,引入RIME框架,利用POEMS工具包生成配对数据,评估多模态语言模型,展示其通过监督微调提升智能体性能,是迈向迭代音乐智能体、变革音乐制作的早期步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04692 2026-07-22 cs.HC 版本更新 50%

Interactive Communication -- cross-disciplinary perspectives from psychology, acoustics, and technology

交互式通信——来自心理学、声学和技术的跨学科视角

Mareike Daeglau, Stephan Getzmann, Moritz Bender, Janina Fels, Rainer Martin, Alexander Raake, Isabel S. Schiller, Sabine J. Schlittmeier, Katrin Schoenenberg, Felix Stärz, Leon O. H. Kroczek

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文从跨学科视角介绍交互式通信,整合心理机制与多方面限制,概述理论框架、总结关键方法,讨论辅助听力技术等应用及伦理考量,强调人类能力与技术系统共同塑造交互式通信,整合相关研究要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23804 2026-07-10 cs.HC eess.SP 版本更新 50%

Perceptually Lossless Tactile Texture Synthesis with Compact Spectral Envelope Models

基于紧凑频谱包络模型的感知无损触觉纹理合成

Jagan K. Balasubramanian, Yasemin Vardar

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 提出两种紧凑频谱表示(频谱β和频谱斜率)来捕获手指-表面摩擦信号的时间频谱结构,通过感知实验验证其能实现与高保真再现相当的感知真实感,为触觉压缩、通信和合成纹理生成提供高效框架。

Comments 16 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10547 2026-07-08 cs.SD 版本更新 50%

HeartMuLa: A Family of Open Sourced Music Foundation Models

HeartMuLa:一个开源音乐基础模型家族

Dongchao Yang, Yuxin Xie, Yuguo Yin, Zheyu Wang, Xiaoyu Yi, Gongxi Zhu, Xiaolong Weng, Zihan Xiong, Yingzhe Ma, Dading Cong, Jingliang Liu, Zihang Huang, Jinghan Ru, Rongjie Huang, Haoran Wan, Peixu Wang, Kuoxi Yu, Helin Wang, Liming Liang, Xianwei Zhuang, Yuanyuan Wang, Dingdong Wang, Haohan Guo, Junjie Cao, Zeqian Ju, Songxiang Liu, Yuewen Cao, Heming Weng, Yuexian Zou

机构 * HeartMuLa Teams(HeartMuLa团队)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 介绍开源音乐基础模型家族HeartMuLa,含四个组件及两种特殊模式,能跨任务和模态推动音乐理解与生成,扩展到7B参数时有显著改进,可重现商业级系统,为未来研究提供基线并促进多模态应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14343 2026-06-23 cs.LG 版本更新 50%

Localizing and Editing Knowledge in Large Audio-Language Models

定位与编辑大型音频-语言模型中的知识

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Auckland, New Zealand(奥克兰大学) Wuhan University, China(武汉大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出首个音频知识定位与编辑基准,通过语音感知因果追踪定位事实知识存储的层和模块,并应用编辑实现细粒度知识控制。

Comments Paper was accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07676 2026-06-16 cs.NE eess.SP 版本更新 50%

A Primer on Evolutionary Optimization Frameworks for Near-Field Multi-Source Localization

近场多源定位的进化优化框架入门

Seyed Jalaleddin Mousavirad, Parisa Ramezani, Mattias O'Nils, Emil Björnson

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出两种基于进化优化的无网格、无训练连续域搜索框架,用于近场多源定位,克服了MUSIC等网格子空间方法和深度学习的局限,通过差分进化实现高精度定位。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏