arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-06 至 2026-04-06 共收录 59 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2507.22264 2026-04-06 cs.CV cs.AI 79%

SmartCLIP: Modular Vision-language Alignment with Identification Guarantees

SmartCLIP: 基于识别保证的模块化视觉-语言对齐

Shaoan Xie, Lingjing Kong, Yujia Zheng, Yu Yao, Zeyu Tang, Eric P. Xing, Guangyi Chen, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SmartCLIP,通过理论条件实现文本与视觉表征的灵活对齐,确保语义信息完整保留并解耦视觉表征,提升多任务性能。

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20554 2026-04-06 cs.CV 72%

When Negation Is a Geometry Problem in Vision-Language Models

当否定是在视觉-语言模型中一个几何问题

Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) imec Independent Researcher(独立研究员)

专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV

AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。

Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 70%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 57%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03139 2026-04-06 cs.RO 50%

FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation

FSUNav: 一种用于快速、安全和通用零样本目标导向导航的脑皮层-小脑架构

Mingao Tan, Yiyang Li, Shanze Wang, Xinming Zhang, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出FSUNav架构,通过整合视觉语言模型与小脑-脑皮层模块,实现跨异构平台的零样本目标导航,提升效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2604.02391 2026-04-06 cs.SD cs.AI eess.AS 84%

Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation

可靠性感知的几何融合用于鲁棒的音频视觉导航

Teng Liu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出RAVN框架,通过音频衍生的可靠性线索条件跨模态融合,动态校准音频和视觉输入的整合,引入Acoustic Geometry Reasoner和Reliability-Aware Geometric Modulation,提升复杂环境下的导航性能。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02389 2026-04-06 cs.SD cs.AI eess.AS 84%

Audio Spatially-Guided Fusion for Audio-Visual Navigation

音频空间引导融合用于音频视觉导航

Xinyu Zhou, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种音频空间引导融合方法,通过自适应提取空间状态信息,实现多模态特征动态对齐与融合,提升在未知声源分布下的导航泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD 83%

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02390 2026-04-06 cs.SD cs.AI eess.AS 81%

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

空间感知条件融合用于音视频导航

Shaohang Wu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出空间感知条件融合(SACF),通过离散化目标相对方向和距离,生成紧凑描述符以指导策略和状态建模,利用音频嵌入和空间描述符生成通道级缩放和偏置,调节视觉特征以生成目标导向的融合表示,提升导航效率和泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2604.02945 2026-04-06 cs.DC 85%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14267 2026-04-06 cs.CV cs.AI cs.MM cs.SD 85%

DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization

DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音

Ngoc-Son Nguyen, Thanh V. T. Tran, Jeongsoo Choi, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen

机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) KAIST, South Korea(韩国科学技术院) University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02891 2026-04-06 cs.CV 83%

Progressive Video Condensation with MLLM Agent for Long-form Video Understanding

逐步视频压缩与MLLM代理用于长视频理解

Yufei Yin, Yuchen Xing, Qianke Meng, Minghao Chen, Yan Yang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出ProVCA,通过逐步缩小范围从粗略片段到精细帧,利用MLLM进行高效视频理解,实现高准确率。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16341 2026-04-06 cs.CV 57%

Motion Capture from Inertial and Vision Sensors

从惯性与视觉传感器进行动作捕捉

Xiaodong Chen, Wu Liu, Qian Bao, Xinchen Liu, Ruoli Dai, Yongdong Zhang, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院) Noitom Technology Ltd.(诺亦腾科技有限公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MINIONS数据集,用于基于单目相机和少量IMU的多模态人体动作捕捉,提出SparseNet框架以展示惯性与视觉传感器在消费级动作捕捉中的潜力。

Comments 12 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2604.03014 2026-04-06 cs.IR cs.AI 83%

User-Aware Conditional Generative Total Correlation Learning for Multi-Modal Recommendation

面向用户的条件生成总相关性学习多模态推荐

Jing Du, Zesheng Ye, Congbo Ma, Feng Liu, Flora. D. Salim

机构 * The University of New South Wales(新南威尔士大学) University of Melbourne(墨尔本大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出GTC框架,通过用户感知的内容特征过滤和总相关性优化,提升多模态推荐的性能,实验表明在NDCG@5上提升达28.30%。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09018 2026-04-06 cs.LG cs.AI cs.CV 62%

Zero-shot Concept Bottleneck Models

零样本概念瓶颈模型

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa, Yasutoshi Ida

机构 * Kyoto University(京都大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出零样本概念瓶颈模型,通过大规模概念库实现无需训练的跨领域概念与标签预测,提供可解释的干预概念。

Comments Accepted to IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2604.02477 2026-04-06 cs.CV cs.LG 79%

Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs

Guideline2Graph:面向可执行临床决策图的多模态解析

Onur Selim Kilic, Yeti Z. Gurbuz, Cem O. Yaldiz, Afra Nawar, Etrit Haxholli, Ogul Can, Eli Waxman

机构 * Georgia Institute of Technology(佐治亚理工学院) MetaDialog Infuse Inc(Infuse公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态解析方法,通过拓扑感知分块、接口约束分块生成和溯源保留的全局聚合,将完整指南证据转换为可执行临床决策支持图。实验表明,该方法在前列腺指南基准上显著提升了精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03225 2026-04-06 cs.CV 57%

VOSR: A Vision-Only Generative Model for Image Super-Resolution

VOSR:一种仅基于视觉的生成模型用于图像超分辨率

Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Xiangtao Kong, Jixin Zhao, Shihao Wang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VOSR,一种仅基于视觉的生成模型,通过视觉语义指导提取低分辨率输入的语义丰富特征,并采用恢复导向的指导策略,实现高效且高质量的图像超分辨率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03133 2026-04-06 physics.soc-ph 50%

Understanding the complexity of frequency and phase angle fluctuations in power grids

理解电力网络中频率和相角波动的复杂性

Alessandro Lonardi, Jacques M. Maritz, Leonardo Rydin Gorjão, Christian Beck

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过超级统计建模方法,分析了电力网络中频率和相角波动的复杂性,揭示了市场驱动的功率波动对电网动态的影响,并展示了低维有效电网模型对南非数据的拟合能力。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03066 2026-04-06 eess.SY cs.SY 50%

Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems

重新定义生命周期终点:面向电子再制造系统的智能自动化

Sibo Tian, Xiao Liang, Sara Behdad, Minghui Zheng

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文探讨电子再制造中智能自动化的核心挑战与机遇,分析机器人、控制与AI在构建可扩展、安全的再制造系统中的作用,提出多模态感知、不确定性决策等方法,为未来再制造系统发展提供指导。

Comments Accepted at the American Control Conference (ACC) 2026; to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05094 2026-04-06 cs.HC 50%

Agentic Link Construction for Environment and Intent Aware 6G Communication

面向环境和意图感知的6G通信代理链路构建

Zhaoyang Li, Shangzhuo Xie, Qianqian Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于强化学习的多模态通信决策模型,实现链路构建的语义对齐与个性化适应,提升6G通信的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 16 篇

2604.03179 2026-04-06 cs.LG cs.AI cs.CV 84%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03198 2026-04-06 cs.CV cs.AI 84%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 81%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00799 2026-04-06 cs.CV cs.CL cs.LG 81%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03050 2026-04-06 cs.HC cs.AI 79%

MECO: A Multimodal Dataset for Emotion and Cognitive Understanding in Older Adults

MECO:一种用于老年人情绪和认知理解的多模态数据集

Hongbin Chen, Jie Li, Wei Wang, Siyang Song, Xiao Gu, Jianqing Li, Wentao Xiang

机构 * Nanjing Medical University(南京医科大学) University of Exeter(埃克塞特大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MECO数据集通过收集42名老年人的多模态信号,提供30592个同步样本,旨在填补老龄化群体情绪和认知预测研究的空白,支持个性化情绪识别和早期轻度认知障碍检测。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 79%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02798 2026-04-06 cs.MM 79%

Differential Mental Disorder Detection with Psychology-Inspired Multimodal Stimuli

基于心理学启发的多模态刺激的差异性精神障碍检测

Zhiyuan Zhou, Jingjing Wu, Zhibo Lei, Junyu Guo, Zhongcheng Yu, Yuqi Chu, Xiaowei Zhang, Qiqi Zhao, Qi Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于心理学启发的多模态刺激方法,通过收集大规模多模态心理健康数据集,设计出能捕捉不同精神障碍特征的框架,实验表明该方法在差异性精神障碍检测中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17069 2026-04-06 cs.CV 79%

Edge-Efficient Two-Stream Multimodal Architecture for Non-Intrusive Bathroom Fall Detection

边缘高效双流多模态架构用于非侵入式浴室跌倒检测

Haitian Wang, Yiren Wang, Xinyu Wang, Sheldon Fung, Atif Mansoor

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出双流架构以编码雷达信号和地面振动,通过低秩双线性交互和Switch-MoE头对齐动与冲击token,提升浴室跌倒检测的准确性和效率。

Comments This paper has been accepted for poster presenation at IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM 67%

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03121 2026-04-06 cs.CR cs.AI cs.CL 62%

An Independent Safety Evaluation of Kimi K2.5

Kimi K2.5 的独立安全性评估

Zheng-Xin Yong, Parv Mahajan, Andy Wang, Ida Caspary, Yernat Yestekov, Zora Che, Mosh Levy, Elle Najt, Dennis Murphy, Prashant Kulkarni, Lev McKinney, Kei Nishimura-Gasparian, Ram Potham, Aengus Lynch, Michael L. Chen

机构 * Constellation Anthropic Fellows Program(Anthropic研究员项目) Brown University(布朗大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Imperial College London(伦敦帝国学院) University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院) Bar Ilan University(巴伊兰大学) University of Toronto(多伦多大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Kimi K2.5作为开源大模型,在安全评估中显示出潜在风险,包括CBRNE滥用、网络安全漏洞及政治偏见,但其在拒绝恶意请求方面表现较弱,凸显开源模型的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏