arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-03 至 2026-07-03 共收录 28 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2412.08907 2026-07-03 cs.CV 版本更新 70%

Towards Interactive Global Geolocation Assistant

迈向交互式全球地理定位助手

Zhiyang Dou, Zipeng Wang, Xumeng Han, Guorong Li, Zhipei Huang, Zhenjun Han

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉学科学院) School of Electronic, Electrical and Communication Engineering, UCAS(中国科学院大学电子、电气与通信工程学院) School of Computer Science and Technology, UCAS(中国科学院大学计算机科学与技术学院)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出基于大型视觉语言模型的交互式全球地理定位助手GaGA,通过挖掘图像地理线索并结合世界知识进行定位,支持用户交互,在GWS15k数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27999 2026-07-03 cs.CV 版本更新 57%

CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition

CLIP-AUTT: 基于动作单元提示的测试时个性化方法用于细粒度视频情绪识别

Muhammad Osama Zeeshan, Masoumeh Sharafi, Benoit Savary, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal(LIVIA, ILLS, 系统工程学院, 蒙特利尔高等技术学院) LIVIA, Dept. of Software and IT Engineering, ETS Montreal(LIVIA, 软件与IT工程学院, 蒙特利尔高等技术学院) Dept. of Computer Science, École Polytechnique(计算机科学系, 巴黎综合理工学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CLIP-AUTT,通过动作单元提示实现测试时个性化,提升细粒度视频情绪识别的鲁棒性和个性化能力。

Comments ECCV, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04101 2026-07-03 cs.CV 版本更新 57%

NEARL: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding

NEARL: 基于正交正则化的交互式查询自适应用于医学视觉-语言理解

Zelin Peng, Yichen Zhao, Yu Huang, Piao Yang, Feilong Tang, Zhengqin Xu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence(人工智能MOE实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学) Department of Radiology(放射科) The First Affiliated Hospital(第一附属医院) School of Medicine(医学院) Zhejiang University(浙江大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) State Key Laboratory of Infrared Physics(红外物理国家重点实验室) Shanghai Institute of Technical Physics(上海技术物理研究所) Chinese Academy of Science(中国科学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出NEARL框架,通过统一协同嵌入变换器(USEformer)和正交交叉注意力适配器(OCA)实现双向跨模态交互,仅引入1.46M参数,在三个医学影像数据集上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2602.08711 2026-07-03 cs.CV 版本更新 79%

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频

Linli Yao, Yuancheng Wei, Yaojie Zhang, Lei Li, Xinlong Chen, Feifan Song, Ziyue Wang, Kun Ouyang, Yuanxin Liu, Lingpeng Kong, Qi Liu, Pengfei Wan, Kun Gai, Yuanxing Zhang, Xu Sun

机构 * South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11606 2026-07-03 cs.SD cs.LG eess.SP 版本更新 78%

Scaling to Multimodal and Multichannel Heart Sound Classification with Synthetic and Augmented Biosignals

利用合成与增强生物信号实现多模态和多通道心音分类的规模化

Milan Marocchi, Matthew Fynn, Kayapanda Mandana, Yue Rong

机构 * School of Electrical Engineering, Computing, and Mathematical Sciences (EECMS), Faculty of Science and Engineering, Curtin University, Bentley, WA 6102, Australia(电气工程、计算与数学科学学院(EECMS),科学与工程学院, Curtin 大学,Bentley,WA 6102,澳大利亚)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对心音分类中同步和多通道数据集有限的问题,提出结合传统信号处理与去噪扩散模型生成增强数据,微调Wav2Vec 2.0分类器,在多个数据集上取得最优性能。

Comments 35 pages, 37 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2602.22897 2026-07-03 cs.AI cs.CL cs.CV cs.LG cs.MM 版本更新 87%

OmniGAIA: Towards Native Omni-Modal AI Agents

OmniGAIA:迈向原生全模态AI代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Haoxuan Li, Hao Wang, Shijian Wang, Guanting Dong, Jiajie Jin, Yinuo Wang, Yuan Lu, Ji-Rong Wen, Zhicheng Dou, Zhouchen Lin

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Peking University(北京大学) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 视频多模态 :omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22872 2026-07-03 cs.CV 版本更新 79%

ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

ForeSea:面向视频监控的多模态查询AI取证搜索

Hyojin Park, Yi Li, Janghoon Cho, Sungha Choi, Jungsoo Lee, Taotao Jing, Shuai Zhang, Munawar Hayat, Dashan Gao, Ning Bi, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22032 2026-07-03 cs.CV 版本更新 79%

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPA:视频JEPA结合多模态轨迹蒸馏实现端到端驾驶

Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

机构 * Virginia Tech(弗吉尼亚理工学院) Purdue University(普渡大学) XPENG Motors(小鹏汽车) Nanjing University(南京大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Drive-JEPA框架,结合视频联合嵌入预测架构(V-JEPA)与多模态轨迹蒸馏,通过自监督视频预训练和动量感知选择机制提升端到端驾驶的规划性能,在NAVSIM上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09604 2026-07-03 cs.CV 版本更新 57%

DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition

DAP:面向异构毫米波的点网络用于人类动作识别

Jiaying Lin, Shiman Wu, Jinfu Liu, Can Wang, Mengyuan Liu

机构 * Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) DJI Technology Company Ltd.(大疆技术创新有限公司) Christian-Albrechts-Universität zu Kiel(基尔大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DAP-Net,通过异构雷达源的跨模态对齐和D2R模块实现点云增强,提升动作识别的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04277 2026-07-03 cs.CV 版本更新 57%

Event-based vision sensing and its application to pedestrian detection for intelligent transportation and surveillance

基于事件的视觉感知及其在智能交通与监控中行人检测的应用

Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li

机构 * Han Wang, Juntao Wu, Jingyuan Bao, Min Liu, Yaoxiong Wang, Saiao Zhou, Yuman Nie, Yun Li(未知)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 综述事件视觉感知原理及其在行人检测中的应用,比较事件驱动与传统帧方法的优劣,分析现有方法并讨论开放挑战与未来方向。

Comments Published in Advanced Engineering Informatics, Vol. 76, Part B, 104989 (2026). Received 31 December 2025; Revised 3 June 2026; Accepted 18 June 2026; Available online 23 June 2026. DOI: 10.1016/j.aei.2026.104989

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2603.05256 2026-07-03 cs.CV 版本更新 79%

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA

Shan Ning, Longtian Qiu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。

Comments Accepted by ICLR 26, code and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08766 2026-07-03 cs.CR 版本更新 50%

Follow My Eyes: Backdoor Attacks on Goal-Directed Scanpath Prediction

跟随我的眼睛:基于VLM的扫视路径预测的后门攻击

Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 2 篇

2507.05624 2026-07-03 cs.AI 版本更新 70%

ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion

ADMC: 基于注意力扩散模型的缺失模态特征补全

Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, Liangze Yin

机构 * National University of Defense Technology(国防科学技术大学) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University(湖南大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出基于注意力扩散的缺失模态特征补全方法,通过独立训练各模态特征网络避免过耦合,利用注意力扩散网络生成与真实分布一致的缺失模态特征,在IEMOCAP和MIntRec基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 57%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 6 篇

2605.17360 2026-07-03 cs.CV 版本更新 79%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 多模态评测 :omni-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15860 2026-07-03 cs.SI 版本更新 78%

PoliTok-DE: A Multimodal Dataset of Political TikToks and Deletions From Germany

PoliTok-DE:德国政治TikTok及删除内容的多模态数据集

Tomas Ruiz, Andreas Nanz, Ursula Kristin Schmid, Carsten Schwemmer, Yannis Theocharis, Diana Rieger

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出PoliTok-DE多模态数据集,包含两次德国选举的93万条TikTok帖子,其中33万条被删除,用于研究不宽容、政治传播及平台政策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20274 2026-07-03 cs.CV 版本更新 70%

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP

Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)

专题命中 多模态评测 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30313 2026-07-03 cs.CV cs.LG 版本更新 57%

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment

TRACE:用于纵向3D胶质母细胞瘤反应评估的概念瓶颈模型

Alia Tarek, Hamsa Saberr, Hamza Elghonemy, Youssef Afify, Tamer Basha, Omair Shahzad Bhatti, Abdulrahman M. Selim, Hasan Md Tusfiqur Alam, Daniel Sonntag

机构 * Department of Biomedical and Healthcare Data Engineering, Faculty of Engineering, Cairo University(生物医学与健康数据工程系,工程学院,开罗大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Oldenburg(奥尔登堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出TRACE模型,通过概念瓶颈架构将RANO 2.0标准融入深度学习,实现可解释的4类胶质母细胞瘤纵向反应分类,在LUMIERE数据集上达到4类宏F1为0.4769,并支持概念校正。

Comments Accept in the EXPLIMED: Explainable Artificial Intelligence for the Medical Domain workshop in IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16130 2026-07-03 cs.CV 版本更新 57%

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法

Zhiwei Wang, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam

机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 50%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 2 篇

2512.14157 2026-07-03 cs.AI cs.CV 版本更新 85%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12144 2026-07-03 cs.MA 版本更新 50%

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing

VERITAS:通过智能系统进行图像派生假设检验的可验证认知推理

Lucas Stoffl, Benedikt Wiestler, Johannes C. Paetzold

专题命中 多模态Agent :multimodal(abstract)

AI总结 VERITAS通过多智能体系统自主测试自然语言假设,生成可审计的证据链,通过四阶段工作流和认知证据标签框架提升医学影像研究的可验证性,达到81.4%的准确率。

Comments 43 pages, 5 figures. Code available at https://github.com/LucZot/veritas

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 3 篇

2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 85%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30217 2026-07-03 cs.CL 版本更新 57%

Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning

在思考之前,先学会决策:面向高效视觉推理的主动路由

Yinan Zhou, Haokun Lin, Yichen Wu, Yuxin Chen, Teng Wang, Caifeng Shan, Zhenan Sun, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent IEG(腾讯IEG ARC实验室) City University of Hong Kong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10710 2026-07-03 cs.CV 版本更新 57%

From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

从一对一到多对多:面向深度视觉-语言融合的动态跨层注入

Cheng Chen, Yuyu Guo, Pengpeng Zeng, Jingkuan Song, Peng Di, Hang Yu, Lianli Gao

机构 * Tongji University(同济大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他多模态 3 篇

2503.04136 2026-07-03 eess.SP 版本更新 78%

FLAME: A Federated Learning Approach for Multi-Modal RF Fingerprinting

FLAME:一种用于多模态射频指纹识别的联邦学习方法

Kasra Borazjani, Kiarash Kianfar, Seyyedali Hosseinalipour, Rajeev Sahay

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出FLAME框架,通过多模态表示(超越I/Q样本)加速联邦学习在射频指纹识别中的训练,理论证明收敛更快且精度更高,实验验证其优越性。

Comments 21 pages, 16 figures. Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19013 2026-07-03 cs.CV 版本更新 57%

GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness

GenHOI:具有遮挡意识的通用手-物体姿态估计

Hui Yang, Wei Sun, Jian Liu, Jian Xiao, Tao Xie, Hossein Rahmani, Ajmal Saeed Mian, Nicu Sebe, Gim Hee Lee

机构 * Hunan University(湖南大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学) University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23561 2026-07-03 stat.ME cs.LG cs.SC stat.CO stat.ML 版本更新 50%

VaSST: Variational Inference for Symbolic Regression using Soft Symbolic Trees

VaSST: 使用软符号树的符号回归变分推断

Somjit Roy, Pritam Dey, Bani K. Mallick

机构 * Department of Statistics, Texas A&M University(统计学系,德克萨斯大学阿姆斯特朗分校)

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出基于变分推断的可扩展符号回归框架VaSST,通过软符号树连续松弛将组合搜索转化为梯度优化,实现不确定性量化,在模拟和费曼数据集上表现优异。

Comments 55 pages, 9 figures, 54 tables, Accepted at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏