arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 69 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2601.08476 2026-04-02 cs.CV cs.MM 81%

Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models

跨模态代理演化用于领域外检测与视觉-语言模型

Hao Tang, Yu Liu, Shuanglin Yan, Fei Shen, Shengfeng He, Jing Qin

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CoEvo框架,通过双向样本条件适应文本和视觉代理,动态挖掘上下文文本负样本并迭代优化视觉代理,提升跨模态对齐和领域外检测鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00455 2026-04-02 cs.CV cs.AI cs.CL 67%

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

首个Logit提升:一种缓解大视觉-语言模型中物体幻觉的视觉 grounding 方法

Jiwoo Ha, Jongwoo Baek, Jinhyun So

机构 * DGIST EECS(大邱庆北科学技术院电子工程与计算机科学系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出FLB方法,通过存储首个生成token的logit并加到后续预测中,缓解大视觉-语言模型中的长期衰减问题,有效减少物体幻觉并保持视觉信息。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00820 2026-04-02 cs.CV 57%

Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis

遥感持续视觉-语言学习:基准测试与分析

Xingxing Weng, Ruifeng Ni, Chao Pang, XiangYu Hao, Yishan Wang, Xiaokang Zhang, Wei Xu, Gui-Song Xia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。

Comments 23 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 57%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2603.19660 2026-04-02 cs.CV cs.SD 83%

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00489 2026-04-02 cs.CL 79%

Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling

通过多模态深度扩展适应文本LLM到语音

Kazuki Yano, Jun Suzuki, Shinji Watanabe

机构 * Tohoku University(东北大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-04-02 cs.HC 78%

FlexAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth Siddharth

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23418 2026-04-02 cs.CR 78%

Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos

超越元数据:多模态、政策感知的YouTube诈骗视频检测

Ummay Kulsum, Aafaq Sabir, Abhinaya S. B., Anupam Das

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。

Comments Accepted at AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00267 2026-04-02 cs.CV 57%

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

Omni-MMSI:迈向基于身份的社会互动理解

Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Omni-MMSI任务,要求从原始音频、视觉和语音输入中全面理解社会互动,通过身份属性的社会线索识别与推理,提升AI助手对人类互动的感知与响应能力。

Comments Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 14 篇

2604.01002 2026-04-02 cs.CV cs.AI cs.LG 81%

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

基于证据的关键帧采样用于基于MLLM的长视频理解

Yiheng Wang, Lichen Zhu, Yueqian Lin, Yudong Liu, Jingyang Zhang, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学) Independent Researcher(独立研究员)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00994 2026-04-02 cs.CL cs.AI cs.SI 81%

Multimodal Analysis of State-Funded News Coverage of the Israel-Hamas War on YouTube Shorts

对以色列-哈马斯战争中YouTube Shorts上国家资助新闻报道的多模态分析

Daniel Miehling, Sandra Kuebler

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态管道,结合自动转录、基于方面的情感分析和语义场景分类,分析国家资助机构对以色列-哈马斯战争的短视频报道,发现不同来源和时间的情感表达差异及视觉线索的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19851 2026-04-02 cs.CV 79%

Towards Online Multi-Modal Social Interaction Understanding

面向在线多模态社交交互理解

Xinpeng Li, Shijian Deng, Bolin Lai, Weiguo Pian, James M. Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出在线多模态社交交互理解问题,通过历史信息实现多模态社交交互理解,采用多模态大语言模型框架,引入多对话者预测和社交感知视觉提示,实现三个任务的最优性能。

Comments Accepted to Transactions on Machine Learning Research (TMLR). Project page: https://sampson-lee.github.io/online-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11797 2026-04-02 cs.HC cs.ET 78%

MURMR: A Multimodal Sensing Framework for Automated Group Behavior Analysis in Mixed Reality

MURMR:一种用于混合现实环境中自动化群体行为分析的多模态传感框架

Diana Romero, Yasra Chandio, Fatima Anwar, Salma Elmalaki

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MURMR框架,通过头显原生数据自动分析团队协作动态,无需外部设备或人工标注,揭示了会话内结构分析和时间模块在捕捉群体行为中的互补作用。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24212 2026-04-02 cs.RO cs.CV 70%

RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation

RANGER:通过视觉上下文适应的单目零样本语义导航框架

Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 RANGER通过视觉上下文学习实现零样本语义导航,无需依赖深度和姿态信息,利用3D基础模型和视觉语言模型提升任务效率与环境适应性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01181 2026-04-02 cs.HC cs.CL cs.CV 62%

True (VIS) Lies: Analyzing How Generative AI Recognizes Intentionality, Rhetoric, and Misleadingness in Visualization Lies

真正的(视觉)谎言:分析生成式AI如何识别意图性、修辞和误导性在可视化谎言中

Graziano Blasilli, Marco Angelini

机构 * Sapienza University of Rome(罗马大学) Link Campus University(Link Campus大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究多模态大语言模型识别和解释误导性可视化的能力,并通过2336条新冠相关推文数据集分析其识别原因和潜在意图性,评估16种前沿模型并对比人类专家行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00416 2026-04-02 cs.RO cs.AI cs.CV cs.LG 62%

Learning Humanoid Navigation from Human Data

从人类数据学习人形导航

Weizhuo Wang, Yanjie Ze, C. Karen Liu, Monroe Kennedy

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoNav系统,通过5小时人类行走数据训练人形机器人自主导航,无需机器人数据或微调。采用扩散模型预测未来轨迹分布,结合360度视觉记忆与DINOv3骨干网络,实现实时推理与路径选择,验证了在未知环境中避障和多模态覆盖的优越性。

Comments 8 pages 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14702 2026-04-02 cs.CV cs.AI 62%

Seeing Beyond the Image: ECG and Anatomical Knowledge-Guided Myocardial Scar Segmentation from Late Gadolinium-Enhanced Images

超越图像:结合心电图与解剖知识的晚期钆增强图像心肌瘢痕分割

Farheen Ramzan, Yusuf Kiberu, Nikesh Jathanna, Meryem Jabrane, Vicente Grau, Shahnaz Jamil-Copley, Richard H. Clayton, Chen, Chen

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Department of Cardiology, Trent Cardiac Centre, Nottingham City Hospital, Nottingham University Hospitals NHS Trust(诺丁汉大学医院NHS信托基金诺丁汉市医院特伦特心脏中心心脏病科) School of Medicine, University of Nottingham(诺丁汉大学医学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种融合心电图电生理信息与AHA-17解剖先验的多模态框架,通过时间感知特征融合机制提升晚期钆增强图像中心肌瘢痕分割的准确性与鲁棒性。

Comments oral presentation at International Symposium on Biomedical Imaging (ISBI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00696 2026-04-02 cs.CV 57%

TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning

TTA-Vid: 视频推理的通用测试时间适应

Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen(蒂宾根大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center(蒂宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TTA-Vid方法,通过测试时间强化学习实现视频推理模型的适应,无需标注数据即可在测试时泛化至新领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV 57%

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00395 2026-04-02 cs.CV 57%

Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge

通过跟踪增强提示推进复杂视频对象分割:第五届PVUW MOSE挑战赛第一名

Jinrong Zhang, Canyang Wu, Xusheng He, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, China(深圳市环区研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TEP方法,通过跟踪增强提示解决SAM3在处理小目标和语义主导对象时的不足,取得PVUW挑战赛优异成绩。

Comments 1st Place Solution for the 5th PVUW MOSE Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-04-02 cs.CV 57%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09388 2026-04-02 cs.CV 57%

Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition

通过邻域感知语义学习,通过开放形式流决策:面向鲁棒零样本骨架动作识别

Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) China University of Geoscience(中国地质大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Flora方法,通过灵活调整文本语义和开放形式分布感知流分类器,解决零样本骨架动作识别中的语义对齐和分类器鲁棒性问题,实验验证其有效性。

Comments Accepted by CVPR 2026 Findings; Project Code: https://github.com/cseeyangchen/Flora

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00832 2026-04-02 cs.HC 50%

Steering through Time: Blending Longitudinal Data with Simulation to Rethink Human-Autonomous Vehicle Interaction

穿越时间:将纵向数据与模拟结合以重新思考人-自动驾驶车辆交互

Yasaman Hakiminejad, Shiva Azimi, Luis Gomero, Elizabeth Pantesco, Irene P. Kan, Meltem Izzetoglu, Arash Tavakoli

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过结合纵向移动传感与高保真驾驶模拟,研究半自动化情境下驾驶员准备状态,揭示基线与任务测量中的个体差异,为个性化驾驶员监控提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2603.25267 2026-04-02 cs.CV 57%

EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval

EagleNet:面向文本-视频检索的能耗感知细粒度关系学习网络

Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao

机构 * Sun Yat-sen University(中山大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Key Laboratory of Adversarial Artificial Intelligence(深圳市对抗性人工智能重点实验室) Beijing Jiaotong University(北京交通大学) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EagleNet,通过细粒度关系学习机制和能耗感知匹配,提升文本-视频检索中文本与视频帧间关系的表达,增强语义匹配能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2604.00550 2026-04-02 cs.AI 79%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05097 2026-04-02 cs.GR cs.CV 79%

Pulp Motion: Framing-aware multimodal camera and human motion generation

纸浆运动:面向场景的多模态摄像机和人体运动生成

Robin Courant, Xi Wang, David Loiseaux, Marc Christie, Vicky Kalogeiton

机构 * LIX, École Polytechnique, CNRS, IPP(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎文理研究大学) Inria Saclay(法国国家信息与自动化研究所萨克雷中心) Inria, IRISA, Univ Rennes, CNRS(法国国家信息与自动化研究所,IRISA,雷恩大学,法国国家科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文首次将人体运动与摄像机轨迹生成联合建模,通过投影人体关节到摄像机生成屏幕构图,实现一致的屏幕构图并提升生成精度,同时引入PulpMotion数据集和辅助采样方法,实验表明方法在生成屏幕一致的人体-摄像机运动和文本对齐方面效果显著。

Comments Project page: https://www.lix.polytechnique.fr/vista/projects/2025_pulpmotion_courant/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 79%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00382 2026-04-02 cs.CV eess.SP 57%

mmAnomaly: Leveraging Visual Context for Robust Anomaly Detection in the Non-Visual World with mmWave Radar

mmAnomaly:利用视觉上下文在非视觉世界中实现鲁棒的异常检测

Tarik Reza Toha, Shao-Jung, Lu, Mahathir Monjur, Shahriar Nirjon

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 mmAnomaly结合毫米波雷达与RGBD输入,通过语义线索和生成模型实现鲁棒的异常检测,应用于隐蔽武器、穿墙入侵和穿墙跌倒检测,达到94%的F1分数和亚米定位精度。

Comments Accepted at the 24th ACM/IEEE International Conference on Embedded Artificial Intelligence and Sensing Systems (SenSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 57%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00319 2026-04-02 cs.AI cs.MA 57%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏