arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-22 至 2026-04-22 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2604.18757 2026-04-22 cs.CV cs.AI 84%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16487 2026-04-22 cs.CV cs.AI 81%

Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering

通过局部跨模态对齐与引导实现几何感知的CLIP检索

Nirmalendu Prakash, Narmeen Fatimah Oozeer, Xin Su, Phillip Howard, Shaan Shah, Zoe Wanying He, Shuang Wu, Shivam Raval, Roy Ka-Wei Lee, Meenakshi Khosla, Amir Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks UCSD(加州大学圣塔莫尼卡分校) Harvard University(哈佛大学)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过局部跨模态对齐与引导改进CLIP检索,通过匈牙利匹配实现邻居级重排序,并利用查询条件局部引导提升属性绑定和组合检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13779 2026-04-22 cs.CV cs.AI 79%

AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison

AD-Copilot:通过视觉上下文比较实现工业异常检测的视觉-语言助手

Xi Jiang, Yue Guo, Jian Li, Yong Liu, Bin-Bin Gao, Hanqiu Deng, Jun Liu, Heng Zhao, Chengjie Wang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) Macau University of Science and Technology(澳门科技大学) Tencent YouTu Lab(腾讯YouTu实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 AD-Copilot通过视觉上下文比较提升工业异常检测性能,采用新颖的数据筛选流程和比较编码器,在多个基准测试中取得优异成绩,超越人类专家水平。

Comments Code and models are released at https://github.com/jam-cc/AD-Copilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG 62%

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL 62%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG 57%

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00161 2026-04-22 cs.CV 57%

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

Q-Mask:面向OCR的视觉语言模型中基于查询的因果遮罩用于文本锚定

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出Q-Mask框架,通过因果查询驱动的遮罩解码器提升OCR任务中文本锚定的准确性与稳定性,结合大规模标注数据集提升视觉语言模型对文本区域的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05437 2026-04-22 cs.CL 57%

Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models

一旦正确,仍错误:多语言视觉-语言模型中的反事实幻觉

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈姆丹·本·哈马德大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究探讨多语言视觉-语言模型在文化背景下反事实幻觉的问题,提出M²CQA基准测试,通过17个中东国家图像和多语言对比陈述评估模型性能,发现阿拉伯语尤其在方言中反事实幻觉率显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2603.21298 2026-04-22 cs.CL cs.AI 81%

More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detection

不止是部分之和:解码多模态仇恨言论检测中的意图转变

Runze Sun, Yu Zheng, Zexuan Xiong, Zhongjin Qu, Lei Chen, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出H-VLI基准和ARCADE框架,通过模拟法庭辩论解码多模态仇恨言论中的隐含意图转变,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14294 2026-04-22 cs.SD cs.AI eess.AS 62%

DASB - Discrete Audio and Speech Benchmark

DASB - 离散音频与语音基准

Pooneh Mousavi, Jarod Duret, Darius Petermann, Artem Ploujnikov, Luca Della Libera, Anastasia Kuznetsova, Cem Subakan, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) Avignon Université(阿维尼昂大学) Université de Montréal(蒙特利尔大学) Université Laval(拉瓦尔大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Indiana University(印第安纳大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出DASB基准,用于评估离散音频token在语音、通用音频和音乐领域的表现,发现离散表示不如连续表示鲁棒,需精细调参,语义token优于声学token,但与连续特征仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15804 2026-04-22 cs.CL eess.AS 62%

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 技术报告

Qwen Team

机构 * Qwen Team(通义实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 Qwen3.5-Omni在多模态能力上取得突破,支持256k上下文长度和多语言理解,通过混合注意力MoE架构实现高效推理,并引入ARIA提升语音合成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2604.18610 2026-04-22 cs.NE cs.AI 83%

SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression

基于脉冲的多模态大语言模型:通过模态特定的时间尺度和时间压缩

Han Xu, Zhiyong Qin, Di Shang, Jiahong Zhang, Xuerui Qiu, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 University of Chinese Academy of Sciences 3 Beijing Academy of Artificial Intelligence 4 Zhongguancun Academy 5 Peking University 6 Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology 7 Spiking Intelligence Lab, Tianqiao \& Chrissy Chen Institute [0.5em] Equal contribution Corresponding authors

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出SpikeMLLM,首个基于脉冲的多模态大语言模型框架,通过模态特定时间尺度和时间压缩技术,在减少时间步数的同时保持高性能,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM 83%

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07259 2026-04-22 cs.CV cs.AI cs.LG cs.MM 82%

COMODO: Cross-Modal Video-to-IMU Distillation for Efficient Egocentric Human Activity Recognition

COMODO:跨模态视频到IMU知识蒸馏用于高效的第一人称人类活动识别

Baiyu Chen, Wilson Wongso, Zechen Li, Yonchanok Khaokaew, Hao Xue, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) King Mongkut's University of Technology North Bangkok(科技技术北巴吞蓬大学) The Hong Kong University of Science(香港科学大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出COMODO框架,通过跨模态自监督蒸馏将视频语义知识转移到IMU,提升第一人称人类活动识别的效率与泛化能力。

Comments IMWUT/UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19217 2026-04-22 cs.CV cs.AI 81%

Attention-based Multi-modal Deep Learning Model of Spatio-temporal Crop Yield Prediction with Satellite, Soil and Climate Data

基于注意力机制的多模态深度学习模型:融合卫星、土壤和气候数据的时空作物产量预测

Gopal Krishna Shyam, Ila Chandrakar

机构 * Presidency University, Bengaluru, India(班加罗尔大学) University of Europe for Applied Sciences, Berlin(欧洲应用科学大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ABMMDLF模型,结合多年的卫星影像、高分辨率气象时间序列和初始土壤属性,通过卷积神经网络提取空间特征和时间注意力机制适应性加权关键物候期,实现高精度时空作物产量预测,R²达0.89。

Comments 6 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 77%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24803 2026-04-22 cs.LG cs.AI 57%

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

TimeOmni-1:通过时间序列激励大型语言模型的复杂推理

Tong Guan, Zijie Meng, Dianqi Li, Shiyu Wang, Chao-Han Huck Yang, Qingsong Wen, Zuozhu Liu, Sabato Marco Siniscalchi, Ming Jin, Shirui Pan

机构 * Griffith University(格里菲斯大学) Zhejiang University(浙江大学) NVIDIA(英伟达) Squirrel Ai Learning University of Palermo(帕尔米奥大学) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TimeOmni-1,首个统一推理模型,通过时间序列推理解决多样化现实问题,提升因果发现和有效响应率。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17797 2026-04-22 cs.CV 57%

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

通过文本监督实现弱监督的指称视频对象分割

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出WSRVOS方法,通过文本表达训练模型,利用对比学习生成正负表达,实现细粒度多模态对齐,并引入实例感知分类和伪掩码融合策略,提升视频对象分割性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11253 2026-04-22 cs.AI 57%

VideoAgent: Personalized Synthesis of Scientific Videos

VideoAgent:科学视频的个性化合成

Xiao Liang, Bangxin Li, Zixuan Chen, Hanyue Zheng, Zhi Ma, Di Wang, Cong Tian, Quan Wang

机构 * RobotY, Xidian University(西电机器人院) ICTT, Xidian University(西电智能技术研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 VideoAgent通过意图驱动的规划问题重新定义科学视频合成,结合静态幻灯片与动态动画,提升叙述的语义密度和教学效果,实验表明其能有效传达复杂技术逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 10 篇

2604.19689 2026-04-22 cs.AI 85%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21893 2026-04-22 cs.LG 82%

Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings

打破幻觉:基于共识的生成对抗多模态嵌入中对抗性幻觉的缓解

Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(隆德大学) Google DeepMind(谷歌DeepMind)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种任务无关的缓解机制,利用生成模型恢复多模态嵌入的自然对齐,通过生成采样策略和共识聚合方案提升防御效果,实验显示其显著降低对抗性幻觉攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19093 2026-04-22 cs.CV cs.AI 81%

Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration

多模态测试时适应 via 自适应概率高斯校准

Jinglin Xu, Yi Li, Chuxiong Sun, Xiao Xu, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) National Defense University(国防大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应概率高斯校准方法,解决多模态测试时适应中类别条件分布建模不足问题,通过引入自适应对比不对称修正技术,提升预测准确性和决策边界可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12735 2026-04-22 cs.CV cs.CL 81%

VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph

VimRAG:通过多模态记忆图导航大规模视觉上下文

Qiuchen Wang, Shihang Wang, Yu Zeng, Qiang Zhang, Fanrui Zhang, Zhuoning Guo, Bosi Zhang, Wenxuan Huang, Lin Chen, Zehui Chen, Pengjun Xie, Ruixue Ding

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VimRAG通过多模态记忆图提升检索增强生成在处理大规模视觉上下文中的能力,采用动态有向无环图结构和图调制视觉记忆编码机制,实现高效的信息检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18892 2026-04-22 cs.CL 79%

Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness

优先选择最佳:通过奖励超越答案正确性来激励可靠的多模态推理

Mengzhao Jia, Zhihan Zhang, Meng Jiang

机构 * University of Notre Dame(北德克萨斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Groupwise Ranking Reward方法,通过在单次遍历中对相同提示下的验证通过轨迹进行排名并重新分配奖励,有效缓解多模态强化学习中的推理-答案不一致问题,提升可靠性条件下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19267 2026-04-22 cs.RO 78%

Multimodal embodiment-aware navigation transformer

多模态具身感知导航Transformer

Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

机构 * LARIAD

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出ViLiNT,通过融合多模态数据提升机器人导航鲁棒性,利用Transformer和扩散模型生成可导航路径,实现在不同环境中导航成功率提升166%。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18965 2026-04-22 eess.SY cs.SY 78%

Transformer Architecture with Minimal Inference Latency for Multi-Modal Wireless Networks

具有最小推理延迟的多模无线网络变压器架构

Minsu Kim, Walid Saad, Kui Wang, Zongdian Li, Tao Yu, Kei Sakaguchi

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出一种快速多模变压器推理框架,通过仅处理重要令牌来支持无线通信任务,减少推理延迟和内存消耗,同时保持任务精度。

Comments Under minor revision, IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14165 2026-04-22 cs.CL 57%

EviSearch: A Human in the Loop System for Extracting and Auditing Clinical Evidence for Systematic Reviews

EviSearch:一个用于系统综述中提取和审计临床证据的人机协作系统

Naman Ahuja, Saniya Mulla, Muhammad Ali Khan, Zaryab Bin Riaz, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 EviSearch通过多智能体系统自动化从原始试验PDF中生成与本体对齐的临床证据表,并提供细胞级可追溯性以供审计和人工验证,提升提取精度并减少手动校对负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19562 2026-04-22 cs.LG 50%

Structure-guided molecular design with contrastive 3D protein-ligand learning

基于结构的分子设计与对比学习3D蛋白质-配体学习

Carles Navarro, Philipp Tholke, Gianni de Fabritiis

机构 * Acellera Labs(Acellera实验室)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出结合对比学习3D结构编码与自回归分子生成的统一框架,用于解决结构导向分子设计中的挑战,生成具有优良结合性质的候选分子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19055 2026-04-22 cs.SD 50%

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

ATRIE:面向基于人物驱动语音合成的鲁棒推理与情感自适应调优

Aoduo Li, Haoran Lv, Shengmin Li, Sihao Qin, Hongjian Xu

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Shenzhen Polytechnic University(深圳职业技术大学) University of Macau(澳门大学) Huizhou University(惠州市大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出ATRIE框架,通过分离静音音色和动态语调生成,实现人物特征的稳定保留与情感表达,实验表明其在生成和跨模态检索上达到SOTA水平。

Comments 10 pages, 6 figures. Accepted to ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏