Generative Diffusion Models for Wireless Networks: Fundamental, Architecture, and State-of-the-Art
生成扩散模型用于无线网络:基础、架构与最新进展
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文综述了生成扩散模型在无线网络中的应用,分析了其在感知、传输和应用领域的技术演进,探讨了核心挑战与潜在解决方案。
Comments 46 pages, 10 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
生成扩散模型用于无线网络:基础、架构与最新进展
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文综述了生成扩散模型在无线网络中的应用,分析了其在感知、传输和应用领域的技术演进,探讨了核心挑战与潜在解决方案。
Comments 46 pages, 10 figures
MUSE:一种面向多模态统一安全评估的运行导向平台
机构 * Duke University(杜克大学) ; Virtue AI
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。
Comments Submitted to ACL 2026 System Demonstration Track
ALARM: 基于多模态大语言模型的复杂环境监控异常检测与不确定性量化
机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) ; Wyze Labs, Inc.(Wyze实验室)
专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 ALARM通过结合不确定性量化与多模态大语言模型,实现了复杂环境中的异常检测,展现出在不同领域中的高准确性和可靠性。
Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; iFLYTEK AI Research(iFLYTEK人工智能研究院) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力
UniG2U-Bench: 统一模型是否能提升多模态理解?
机构 * Microsoft Research Asia(微软亚洲研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学) ; University of Oxford(牛津大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。
多模态人类样注意机制在视觉问答中的整合
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 MULAN通过整合文本和图像显著性模型的注意预测,提升了VQA模型的性能,同时减少参数数量,达到新的准确率水平。
VQA-MHUG:一个用于研究视觉问答中多模态神经注意机制的注视数据集
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 VQA-MHUG数据集用于研究视觉问答中多模态神经注意机制,发现文本注意与模型性能的相关性是提升VQA性能的关键因素。
Comments CoNLL 2021
多模态先验引导的重要性采样用于稀疏视图新视图合成中的分层高斯点云
机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东超高清沉浸媒体技术重点实验室) ; Shenzhen Graduate School, Peking University(北京大学深圳研究生院) ; Peng Cheng Laboratory(鹏城实验室) ; Migu Culture Technology Co., Ltd.(米果文化科技有限公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出多模态先验引导的重要性采样方法,用于稀疏视图新视图合成中的分层高斯点云,通过融合光度残差、语义和几何先验,提升重建质量。
无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; Zhongguancun Academy, China(中关村学院) ; School of Computer Science, Chongqing University, China(重庆大学计算机学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。
学习称重垃圾:一种融合多模态的物理引导框架和大规模数据集用于商业和工业应用
机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际大学) ; Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) ; Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) ; Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学) ; Faculty of Arts and Society, Charles Darwin University(艺术与社会学院,查尔斯达尔文大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出了一种融合多模态的物理引导框架和大规模数据集,用于准确估计商业和工业垃圾的重量,通过结合视觉和物理信息提升预测精度。
MMTok: 为VLMs高效推理的多模态覆盖最大化
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 MMTok通过多模态覆盖准则提升VLMs推理效率,结合视觉和文本信息优化标记选择,实现性能与速度的平衡。
Comments Accepted by ICLR 2026. Code: https://github.com/Ironieser/mmtok , Project Homepage: https://project.ironieser.cc/mmtok
通过镜头进行Doxing:揭示多模态大推理模型中的位置相关隐私泄露
机构 * University of Georgia(佐治亚大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; John Hopkins University(约翰·霍普金斯大学) ; University of Southern California(南加州大学) ; University of Maryland, College Park(马里兰大学学院市分校)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI
AI总结 本文研究了多模态大推理模型中的位置隐私泄露问题,提出DoxBench和GeoMiner框架,揭示模型在推断地理位置信息上的能力及隐私风险。
Comments Camera-ready version. Accepted as a poster at the 14th International Conference on Learning Representations (ICLR 2026). For official ICLR page, see https://iclr.cc/virtual/2026/poster/10006914
合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。
Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop
教室期末考试:一个由教师测试的推理基准
机构 * Northwestern University(西北大学) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; Duke University(杜克大学) ; University of Birmingham(伯明翰大学) ; University of Rochester(罗切斯特大学) ; Analogy AI, Inc.(Analogy AI 公司)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 CFE-Bench是一个由教师测试的多模态推理基准,用于评估大语言模型在STEM领域中的推理能力,发现前沿模型在多步骤解决方案中存在中间状态推导和保持的困难。
SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解
机构 * Zhejiang University(浙江大学) ; School of Software Technology, Zhejiang University(软件技术学院,浙江大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。
在线数据整理用于目标检测:通过数据集层面平均精度的边际贡献
机构 * Sony Group Corporation(索尼集团)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 DetGain是一种针对目标检测的在线数据整理方法,通过估计图像对数据集层面平均精度的边际影响,提升检测性能并增强鲁棒性。
Comments preprint version
视觉-语言模型是否准备好在自动驾驶中具备车道拓扑意识?
机构 * Shandong University(山东大学) ; MBZUAI ; Sems
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文评估了VLMs在自动驾驶中理解道路拓扑结构的能力,发现尽管闭源模型在部分任务表现良好,但空间推理仍是其主要瓶颈,且模型规模和推理令牌数量对性能有显著影响。
Comments 5 pages, 5 figures
MERIT数据集:模型与高效可解释 transcripts 的渲染
机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究 institute,ICAI 工程学院,科利马天主教大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 MERIT数据集通过多模态信息和偏见控制,为训练视觉丰富文档理解模型提供挑战性资源。
基于上下文的深度学习网络入侵检测:方法、数据、评估与部署
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出基于上下文的深度学习方法,用于改进网络入侵检测,强调评估和部署的现实性,探讨上下文对检测效果的影响。
理解交互对虚拟现实中情感体验的影响
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文通过扩展VR情绪激发数据集,探讨交互对情感体验的影响,发现交互可增强情绪并调节其在不同情境中的表现。
Comments 20 pages, 17 figures, to be published in the Proceedings of the 2026 ACM CHI Conference on Human Factors in Computing Systems
迈向自适应社交游戏机器人:一种基于离线强化学习的框架
机构 * Department of Mechanical Engineering, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校机械工程系)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出了一种基于离线强化学习的自适应社交游戏机器人框架,通过整合多模态情绪识别与自适应响应,提升机器人在游戏场景中对用户情绪的适应能力。
Comments Submitted to conference
LLandMark:一种用于地标感知多模态交互视频检索的多智能体框架
机构 * AI VIETNAM(AI越南)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 LLandMark通过多智能体框架实现地标感知的多模态视频检索,结合LLM和OCR技术提升文化场景下的检索能力与可解释性。
Comments Accepted by AAAI 2026 Workshop on New Frontiers in Information Retrieval
Journal ref AAAI 2026 Workshop on New Frontiers in Information Retrieval
见与忆:一种用于网页浏览的多模态代理
机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) ; East China Normal University(华东师范大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%
具有自适应测试时间缩放的代理混合源多模态虚假信息检测
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.MM
AI总结 AgentM3D通过自适应测试时间缩放和多代理框架提升零样本多模态虚假信息检测性能。
基于AutoGen的多模态多智能体勒索软件分析
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出基于AutoGen的多模态多智能体框架,通过融合静态、动态和网络信息,提升勒索软件分类的准确性和稳定性。
Comments 46 pages, 11 figures and 10 tables
SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; West China Hospital, Sichuan University(四川大学华西医院) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态Agent :multimodal(title,abstract)
AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。
动态多模式网络中动态O-D需求与选择模型的联合估计:基于计算图的学习与假设检验
专题命中 多模态Agent :multi-modal(title,abstract)
AI总结 本研究提出基于计算图的学习方法,联合估计多模式网络中动态O-D需求与选择模型,通过假设检验框架提升模型的统计显著性分析。
PlayWrite: 一种通过XR中的游戏化互动实现AI支持的叙事协作写作的多模态系统
机构 * Institute of Neurosciences of the University of Barcelona(巴塞罗那大学神经科学研究所) ; Autodesk Research(Autodesk研究)
专题命中 多模态Agent :multimodal(title);分类 cs.AI
AI总结 PlayWrite是一种通过XR中的游戏化互动实现AI支持的叙事协作写作的多模态系统,通过直接操控虚拟角色和道具,结合多智能体AI管道和大型语言模型,促进高度即兴和游戏化的创作过程。
ACE-Brain-0:空间智能作为通用具身化体系的共享框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学) ; University of Science(科学技术大学) ; Fudan University(复旦大学) ; Xiamen University(厦门大学) ; East China Normal University(华东师范大学) ; Wuhan University(武汉大学) ; Sun Yat-sen University(中山大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。
Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B
Earth-Agent: 解锁地球观测的全貌与潜力
专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV
AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。
Comments Published as a conference paper at ICLR 2026