arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-29 至 2026-06-29 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2606.28266 2026-06-29 cs.CV 新提交 74%

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 62%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交 57%

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 82%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 57%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27380 2026-06-29 cs.CL 新提交 57%

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

自动演讲辅导系统综述:系统、方法与开放挑战

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司) RoleGaku

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述自动演讲辅导系统,提出五维任务分类法,覆盖发音、韵律、节奏和内容忠实度,并分析TTS示例生成与诊断方法,指出语料稀缺、口音公平和低延迟诊断等挑战。

Comments accepted into the BEA 2026 workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2606.28089 2026-06-29 cs.CV 新提交 79%

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

RPM-Distill:生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

机构 * McGill University(麦吉尔大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出RPM-Distill框架,利用训练时的雷达信号通过频域蒸馏指导视频模型,提升光照、肤色和运动变化下的远程心率估计鲁棒性,在挑战性条件下MAE降低81%,相关性提升21%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27576 2026-06-29 cs.CV 新提交 79%

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

DeLux: 利用神经形态数据进行视频中的跨模态局部伪影修复

Bartosz Stachowiak, Dariusz Brzezinski

机构 * Institute of Computing Science, Poznan University of Technology(波兹南技术大学计算机科学学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出DeLux,一种利用神经形态事件流作为结构先验,引导RGB视频中光照伪影检测与修复的跨模态修复方法,在合成和真实数据上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 77%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 视频多模态 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 67%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交 57%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24253 2026-06-29 cs.CV 新提交 57%

TuringViT: Making SOTA Vision Transformers Accessible to All

TuringViT:让最先进的视觉Transformer人人可用

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2606.27831 2026-06-29 cs.CV cs.AI 新提交 62%

Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modeling

Hippocampus-DETR: 基于海马体建模的显式记忆目标检测框架

Zhaoning Shi, Bo Ma, Hao Xu, Zepeng Yang, Bo Liang

机构 * Beijing institute of Technology(北京理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对目标检测模型缺乏显式记忆机制的问题,提出Hippocampus-DETR框架,通过模拟海马体亚区结构实现模式分离与补全,提升检测精度及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27794 2026-06-29 cs.CV 新提交 57%

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

文本作为照明:面向语言引导医学图像分割的空间对比度Retinex学习

Jian Shi, Cheng Zhen, Pingping Zhang, Rui Xu, Yanan Lv, Yili Ma, Huan Bi, Haojie Li, Huchuan Lu

机构 * School of Software Technology & DUT-RU International School of Information Science and Engineering, Dalian University of Technology(大连理工大学软件学院 & 大连理工大学-俄罗斯国际信息科学与工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) Central Hospital of Dalian University of Technology(大连理工大学中心医院) Cancer Hospital of Dalian University of Technology(大连理工大学肿瘤医院) College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出TIRNet框架,将文本嵌入作为语义照明调制特征,通过Retinex启发模块和对比损失实现语言与分割的精确对齐,在MosMedData+和QaTa-COV19数据集上取得最优性能。

Comments Aceepted by MICCAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2606.27923 2026-06-29 cs.CV cs.AI 新提交 62%

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, Yindong Kong, Jing Li, Qi Wu, Feng Zhang, Jianan Jiang, Ruigao Yang

机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。

Comments 18 pages, 10 figures, 2 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27766 2026-06-29 cs.LG cs.AI cs.RO 新提交 57%

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

RS-Diffuser: 基于分布价值引导的风险敏感扩散规划

Shiqiang Gong

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出RS-Diffuser,一种结合扩散轨迹生成与分布价值评论家的风险敏感离线规划框架,通过尾部感知目标引导去噪过程,实现灵活的风险偏好行为,在风险敏感D4RL和机器人导航基准上达到最优性能。

Comments ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交 57%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 13 篇

2606.16682 2026-06-29 cs.LG cs.CL 新提交 88%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 84%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 83%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27499 2026-06-29 cs.CV cs.AI cs.CL 新提交 82%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28104 2026-06-29 cs.CV cs.LG 新提交 79%

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

跨视角多模态视觉评估框架用于中医康复训练

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) Institute for Regeneration and Repair, The University of Edinburgh(爱丁堡大学再生与修复研究所) Ningbo Hospital of Traditional Chinese Medicine(宁波市中医院) Department of Rehabilitation Medicine, The Gulou Hospital of Traditional Chinese Medicine(南京市鼓楼区中医院康复医学科)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出跨视角多模态视觉评估框架CME-AQA,融合视觉-姿态信息,利用第一人称和第三人称视频提升推理鲁棒性,在中医康复训练动作质量评估中取得优于基线10%的加权F1提升。

Comments Published in IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2026

Journal ref IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交 79%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27886 2026-06-29 cs.LG 新提交 78%

A Comparison of Fusion Techniques for Multi-Modal Human Activity Recognition on the HARMES Dataset

HARMES数据集上多模态人类活动识别融合技术的比较

Ahmed Mohamady, Robin Burchard, Kristof Van Laerhoven

机构 * University of Siegen(锡根大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 系统比较七种传感器融合方法在HARMES多模态数据集上的性能,发现门控多模态融合在留一参与者评估中宏F1分数达0.82,优于拼接式后期融合基线(0.76)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 78%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27413 2026-06-29 q-bio.GN cs.AI 新提交 70%

GRAFT: Biological Graph and Hypergraph Benchmarks for Linked Gene Expression and Phenotypic Trait Prediction in Arabidopsis thaliana

GRAFT:用于拟南芥连锁基因表达与表型性状预测的生物图与超图基准

Manuel Serna-Aguilera, Vanshika Jindal, Fiona L. Goggin, Jiamei Li, Aranyak Goswami, Alexander Bucksch, Suxing Liu, Khoa Luu

机构 * Department of Electrical Engineering and Computer Science, University of Arkansas(电气工程与计算机科学系,亚拉巴马大学) Department of Entomology and Plant Pathology, University of Arkansas(昆虫学与植物病理学系,亚拉巴马大学) Department of Animal Science, University of Arkansas(动物科学系,亚拉巴马大学) School of Plant Sciences, University of Arizona(植物科学学院,亚利桑那大学) Georgia State University(佐治亚州立大学) CVIU Lab, University of Arkansas(CVIU实验室,亚拉巴马大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出GRAFT多模态数据集,整合拟南芥基因表达与表型性状数据,支持表型预测和可解释图学习,并基准测试回归与超图基线方法。

Comments arXiv admin note: text overlap with arXiv:2508.14934

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 62%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28274 2026-06-29 cs.LG cs.AI 新提交 57%

Parameter Efficient Hybrid Transformer (PEHT) for Network Traffic Prediction via Dynamic Urban Congestion Integration

参数高效混合Transformer(PEHT)用于通过动态城市拥堵整合进行网络流量预测

Abdolazim Rezaei, Mehdi Sookhak, Mahboobeh Haghparast

机构 * National Science Foundation(国家科学基金会) U.S. Department of Transportation(美国交通部) University Transportation Center (UTC)(大学交通中心) Transportation Cybersecurity Center for Advanced Research and Education (CYBER-CARE)(交通网络安全高级研究与教育中心) NVIDIA Academic Grant Program(NVIDIA学术资助计划)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出参数高效混合Transformer(PEHT),通过低秩适应和多模态融合整合城市移动性与拥堵信息,在减少参数的同时提升网络流量预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28310 2026-06-29 astro-ph.CO 新提交 50%

Constraining primordial oscillations and inflationary particle production with Planck, ACT DR6, and DESI DR2

利用Planck、ACT DR6和DESI DR2约束原初振荡与暴胀粒子产生

Simran K. Nerval, Renee Hlozek, Hidde T. Jense, J. Richard Bond

专题命中 多模态评测 :multimodal(abstract)

AI总结 利用CMB和LSS数据,通过pocoMC采样器约束原初功率谱振荡模板及暴胀粒子产生模型,发现振幅上限约2% A_s,贝叶斯证据仍偏好ΛCDM。

Comments 34 pages, 24 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏