arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-26 至 2026-03-26 共收录 62 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2603.24059 2026-03-26 cs.CV 79%

AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis

AD-Reasoning:多模态指南引导推理用于阿尔茨海默病诊断

Qiuhui Chen, Yushan Deng, Xuancheng Yao, Yi Hong

机构 * School of Information Science and Engineering(信息科学与工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AD-Reasoning框架,结合结构MRI和六种临床模态,生成符合NIA-AA标准的诊断,通过强化学习提升透明度和指南一致性。

Comments ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24358 2026-03-26 cs.HC cs.LG 78%

A Neuro-Symbolic System for Interpretable Multimodal Physiological Signals Integration in Human Fatigue Detection

一种用于人类疲劳检测中可解释多模态生理信号整合的神经符号系统

Mohammadreza Jamalifard, Yaxiong Lei, Parasto Azizinezhad, Javier Fumanal-Idocin, Javier Andreu-Perez

机构 * School of Computer Science and Electronic Engineering(计算机科学与电子工程学院) University of Essex(埃塞克斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出一种神经符号系统,通过注意力编码器整合可解释的生理概念,结合可微近似推理规则,提升疲劳检测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 78%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 70%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23883 2026-03-26 cs.CV 70%

BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment

BioVITA: 生物数据集、模型和基准用于视觉-文本-音频对齐

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Kuniaki Saito, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究所) OMRON SINIC X

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出BioVITA框架,通过大规模数据集、模型和跨模态检索基准,实现生物物种的多模态对齐,提升生物多样性理解。

Comments CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11809 2026-03-26 cs.HC cs.RO 67%

HiSync: Spatio-Temporally Aligning Hand Motion from Wearable IMU and On-Robot Camera for Command Source Identification in Long-Range HRI

HiSync: 从可穿戴IMU和机器人摄像头同步手部运动以在远距离HRI中进行命令源识别

Chengwen Zhang, Chun Yu, Borong Zhuang, Haopeng Jin, Qingyang Wan, Zhuojun Li, Zhe He, Zhoutong Ye, Yu Mei, Chang Liu, Weinan Shi, Yuanchun Shi

机构 * Department of Computer Science Technology, BNRist Tsinghua University Beijing China Technology, BNRist, College of AI Tsinghua University Beijing China Technology Tsinghua University Beijing China Beijing University of Posts Academy of Arts \& Design Tsinghua University Beijing China Qinghai University Xining China Tsinghua University Technology, BNRist, College of AI Technology Tsinghua University Academy of Arts \& Design Tsinghua University Qinghai University

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 HiSync通过同步机器人摄像头光流与手环IMU信号,提取频域手部运动特征并融合多模态数据,实现远距离多用户HRI中的高准确率命令源识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02441 2026-03-26 cs.CV cs.AI 66%

Understanding Pure Textual Reasoning for Blind Image Quality Assessment

理解纯文本推理在盲图像质量评估中的应用

Yuan Li, Shin'ya Nishida

机构 * Kyoto University(京都大学)

专题命中 多模态评测 :image-text(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文从信息流角度探讨文本信息对图像质量预测的贡献,通过对比现有模型与三种文本推理方法,发现文本信息在质量预测中效果有限,但Self-Consistency方法显著缩小了图像与文本预测间的差异。

Comments Code available at https://github.com/AnonymousUserPublish/Bridging-Image-Text-Gap-for-BIQA/tree/main. This work is accepted by ICME (IEEE International Conference on Multimedia and Expo) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23627 2026-03-26 cs.CV cs.AI 62%

Ukrainian Visual Word Sense Disambiguation Benchmark

乌克兰视觉词义消歧基准

Yurii Laba, Yaryna Mohytych, Ivanna Rohulia, Halyna Kyryleyza, Hanna Dydyk-Meush, Oles Dobosevych, Rostyslav Hryniv

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个评估乌克兰视觉词义消歧任务的基准,通过八种多语言大模型测试,发现乌克兰与英语在该任务上存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11442 2026-03-26 cs.AI cs.CV 62%

GPT4o-Receipt: A Dataset and Human Study for AI-Generated Document Forensics

GPT4o-Receipt:用于AI生成文档取证的数据库和人类研究

Yan Zhang, Simiao Ren, Ankit Raj, En Wei, Dennis Ng, Alex Shen, Jiayu Xue, Yuxin Zhang, Evelyn Marotta

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨人类是否能比机器更有效检测AI生成的财务文档,通过GPT4o-Receipt数据库和人类研究揭示了AI生成文档中的算术错误对机器学习模型的影响。

Comments 12 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23481 2026-03-26 cs.CL 57%

IDP Accelerator: Agentic Document Intelligence from Extraction to Compliance Validation

IDP加速器:从提取到合规验证的智能文档智能

Md Mofijul Islam, Md Sirajus Salekin, Joe King, Priyashree Roy, Vamsi Thilak Gudi, Spencer Romo, Akhil Nooney, David Kaleko, Boyi Xie, Bob Strahan, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出IDP加速器框架,通过DocSplit、可配置提取模块、代理分析模块和规则验证模块实现端到端文档智能,展示在医疗行业达到98%准确率和77%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 57%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 56%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 多模态评测 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20150 2026-03-26 cs.RO 50%

HortiMulti: A Multi-Sensor Dataset for Localisation and Mapping in Horticultural Polytunnels

HortiMulti:一种用于温室局部化与建图的多传感器数据集

Shuoyuan Xu, Zhipeng Zhong, Tiago Barros, Matthew Coombes, Cristiano Premebida, Hao Wu, Cunjia Liu

机构 * Department of Aeronautical and Automotive Engineering, Loughborough University(航空航天与汽车工程系,洛桑大学) Department of Electrical and Computer Engineering, Institute of Systems and Robotics, University of Coimbra(电气与计算机工程系,系统与机器人研究所,科英布拉大学) Antobot Ltd, Arise Innovation Hub(Antobot公司,Arise创新中心)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出HortiMulti数据集,用于解决温室环境中局部化与建图的挑战,通过多传感器数据验证现有方法的不足,为农业机器人提供可靠资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23583 2026-03-26 q-bio.BM cs.LG 50%

ZeroFold: Protein-RNA Binding Affinity Predictions from Pre-Structural Embeddings

ZeroFold:从预结构嵌入预测蛋白质- RNA结合亲和力

Josef Hanke, Sebastian Pujalte Ojeda, Shengyu Zhang, Werngard Czechtizky, Leonardo De Maria, Michele Vendruscolo

机构 * Centre for Misfolding Diseases, Yusuf Hamied Department of Chemistry, University of Cambridge(错误折叠疾病中心,尤斯夫·哈米埃德化学系,剑桥大学) Medicinal Chemistry, Research and Early Development, Respiratory and Immunology, BioPharmaceuticals R&D, AstraZeneca(药物化学,研发与早期开发,呼吸与免疫学,生物制药研发,阿斯利康)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 本文提出ZeroFold模型,利用预结构嵌入预测蛋白质- RNA结合亲和力,通过跨模态注意力机制结合蛋白质和RNA的预结构嵌入,构建了PRADB数据集并验证了模型性能。

Comments 16 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 4 篇

2509.22460 2026-03-26 cs.AI 83%

GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation

GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换

Shichao Weng, Zhiqiang Wang, Yuhua Zhou, Rui Lu, Ting Liu, Zhiyang Teng, Xiaozhang Liu, Hanmeng Liu

机构 * Fudan University(复旦大学) IFLYTEK CO.LTD(若lytek有限公司) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Defense Technology(国防科技大学) Hainan University(海南大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24533 2026-03-26 cs.LG cs.AI cs.CV 62%

UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience

UI-Voyager:一种通过失败经验自我进化的GUI代理学习

Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu, Zhicong Lu, Yangbin Yu, Mingyu Yang, Junyou Li, Deheng Ye, Jie Jiang

机构 * Tencent(腾讯)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UI-Voyager,一种两阶段自我进化的移动GUI代理,通过拒绝微调和组相对自蒸馏提升GUI任务的效率和性能,实验显示其在AndroidWorld上达到81.0%的Pass@1成功率。

Comments Code and models are available at https://github.com/ui-voyager/UI-Voyager

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24157 2026-03-26 cs.CV 57%

CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare

CarePilot: 一种用于医疗领域长周期计算机任务自动化的多智能体框架

Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Mohamed bin Zayed University of AI (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出CarePilot多智能体框架,通过双记忆机制和actor-critic范式,解决医疗领域长周期任务自动化中的复杂推理问题,实验表明其在基准和分布外数据集上均优于现有基线。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24328 2026-03-26 eess.SP 50%

Towards Semantic-based Agent Communication Networks: Vision, Technologies, and Challenges

迈向基于语义的智能体通信网络:愿景、技术与挑战

Ping Zhang, Rui Meng, Xiaodong Xu, Yaheng Wang, Zixuan Huang, Yiming Liu, Ruichen Zhang, Yinqiu Liu, Haonan Tong, Huishi Song, Gang Wu, Zhaoming Lu, Jiawen Kang, Geng Sun, Qinghe Du, Zhaohui Yang, Jingxuan Zhang, Han Meng, Lexi Xu, Haitao Zhao, Zesong Fei, Yiqing Zhou, Pei Xiao, Meixia Tao, Qinyu Zhang, Shuguang Cui, Rahim Tafazolli

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文探讨语义在智能体通信网络中的作用,提出新的架构并综述现有技术,识别关键挑战并提出解决方案。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2603.24109 2026-03-26 eess.IV cs.AI cs.CV 84%

Comparative analysis of dual-form networks for live land monitoring using multi-modal satellite image time series

多模态卫星图像时间序列用于实时土地监测的双形式网络比较分析

Iris Dumeur, Jérémy Anger, Gabriele Facciolo

机构 * 1 Kayrros SAS 2 Universit\'e Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, 91190, Gif-sur-Yvette, France 3 Institut Universitaire de France

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了双形式注意力机制以提升多模态SITS分析效率,通过并行训练支持递归推理,针对时间不规则性和不一致性的挑战,提出基于实际获取日期计算token距离的方法,实验表明双形式机制在性能和效率上优于标准Transformer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11380 2026-03-26 cs.CV 83%

DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding

DriveXQA: 多模态视觉问答用于恶劣驾驶场景理解

Mingzhe Tao, Ruiping Liu, Junwei Zheng, Yufan Chen, Kedi Ying, M. Saquib Sarfraz, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出DriveXQA多模态数据集,用于自主驾驶场景中的视觉问答,通过融合多传感器信息提升对异常驾驶场景的理解能力。

Comments Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24528 2026-03-26 cs.CV 79%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23650 2026-03-26 cs.CV 79%

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

基础模型嵌入与混合情感:一种多模态融合方法用于BLEMORE挑战

Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

机构 * Department of Computational Linguistics, University of Zürich(苏黎世大学计算语言学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多模态融合方法,结合六个编码器家族进行后期概率融合,通过选择冻结的Wav2Vec2的语调编码层和Gemini Embedding 2.0,提升了混合情感识别的性能,最终在测试集上获得0.279的分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24024 2026-03-26 eess.SP 78%

Sensing-Assisted Adaptive Beam Probing with Calibrated Multimodal Priors and Uncertainty-Aware Scheduling

基于校准多模态先验和不确定性感知调度的传感辅助自适应波束探测

Abidemi Orimogunje, Vukan Ninkovic, Ognjen Kundacina, Hyunwoo Park, Sunwoo Kim, Dejan Vukobratovic, Evariste Twahirwa, Gaspard Gashema

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种传感辅助自适应探测策略,利用多模态传感数据校准波束先验,通过深度Q-集合预测波束奖励并结合置信度调度,减少训练开销并提高可靠性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 73%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24296 2026-03-26 cs.CV 57%

AMIF: Authorizable Medical Image Fusion Model with Built-in Authentication

AMIF:具有内置认证的可授权医学图像融合模型

Jie Song, Jun Jia, Wei Sun, Wangqiu Zhou, Tao Tan, Guangtao Zhai

机构 * Macao Polytechnic University(澳门理工学院) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AMIF,首个具有内置认证的医学图像融合模型,通过授权访问控制保护知识产权,防止推理泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24371 2026-03-26 physics.optics 50%

Shape-Dependent, Deep-Learning-Assisted Metamaterial Solid Immersion Lens (mSIL) Super-Resolution Imaging

形状依赖、深度学习辅助的超材料固体浸没透镜(mSIL)超分辨成像

Baidong Wu, Fiza Khan, Lingya Yu, Zengbo Wang

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文比较了三种TiO2超材料固体浸没透镜几何结构,通过SEM分析发现超半球形透镜具有最深的浸没和最接近样品特征的接触,结合深度学习模型实现了SEM形态与光学成像响应的跨模态映射,电磁模拟证实了浸没深度与远场主波束强度的直接相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24265 2026-03-26 cs.LG 50%

DeepDTF: Dual-Branch Transformer Fusion for Multi-Omics Anticancer Drug Response Prediction

DeepDTF: 多组学抗癌症药物反应预测的双分支Transformer融合

Yuhan Zhao, Jacob Tennant, James Yang, Zhishan Guo, Young Whang, Ning Sui

机构 * Department of Computer Science(计算机科学系) North Carolina State University(北卡罗来纳州立大学) UNC School of Medicine(UNC医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 DeepDTF通过双分支Transformer融合框架,联合预测药物IC50对数和敏感性分类,有效整合多组学数据与化学结构信息,提升药物反应预测精度与生物解释性。

Comments 7 Pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 5 篇

2603.24004 2026-03-26 cs.CL 83%

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

基于表格的思考:通过神经符号推理增强多模态表格理解

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08126 2026-03-26 cs.CL 79%

Quantification and object perception in Multimodal Large Language Models and human linguistic cognition

多模态大语言模型和人类语言认知中的量化与物体感知

Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级科研与研究机构(ICREA))

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型和人类在量化中的关键特征,探讨其在模型架构中的编码差异及语言影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24138 2026-03-26 cs.LG cs.SY eess.SY 78%

Efficient Controller Learning from Human Preferences and Numerical Data Via Multi-Modal Surrogate Models

通过多模态代理模型高效学习人类偏好和数值数据的控制器

Lukas Theiner, Maik Pfefferkorn, Yongpeng Zhao, Sebastian Hirt, Rolf Findeisen

机构 * Control and Cyber-Physical Systems Laboratory, Technical University of Darmstadt(控制与网络物理系统实验室,德累斯顿技术大学) Volkswagen AG(大众汽车集团)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出一种多保真度、多模态贝叶斯优化框架,结合低保真度数值数据与高保真度人类偏好,提升控制器学习效率。

Comments 8 pages, 4 figures, accepted for ECC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏