arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-19 至 2026-08-19 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2608.17717 2026-08-19 cs.RO 新提交 78%

CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation

CompCPZ:在语言引导的机器人操作中保留多模态意图

Zhen Zhang, Ahmad Hafez, Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 图文多模态 :multi-modal(title,abstract)

AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09948 2026-08-19 cs.AI cs.CV cs.RO 版本更新 62%

LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

LoopVLA: 在视觉-语言-动作模型中学习充分性

Boyang Shen, Kaixiang Yang, Hao Wang, Qiuyu Yu, Qiang Xie, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23088 2026-08-19 cs.CV 版本更新 57%

Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy

词中结构:用于人类大脑显微镜的弱监督视觉-语言建模

Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。

Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2608.17102 2026-08-19 cs.CL eess.AS eess.IV 新提交 91%

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

跨语音与面部的情感:多模态基础模型中的共享情感机制

Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06040 2026-08-19 cs.SD cs.AI eess.AS 版本更新 62%

Audio Physical Dynamics Inspired Deepfake Detection for Voice Authentication Systems

基于物理的深度伪造检测用于语音认证系统

Alireza Mohammadi, Keshav Sood, Dhananjay Thiruvady, Asef Nazari

机构 * School of Information Technology, Deakin University(信息科技学院,德金大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种结合物理指导的深度伪造检测与边缘学习不确定性的框架,用于提升网络语音认证系统的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17852 2026-08-19 cs.SD cs.MM 新提交 57%

UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding

UniVerse:针对文化包容性低资源音乐理解的基准测试与增强

Ziya Zhou, Shangda Wu, Shenyang Xu, Yutong Zheng, Dafang Liang, Suin Chung, Danbinaerin Han, Junyan Jiang, Yongyi Zang, Ruibin Yuan, Rongxiu Zhong, Shilei Zhang, Junlan Feng, Jinglei Liu, Haotian Zhou, Zijin Li, Dasaem Jeong, Wei Xue, Yike Guo

机构 * Sogang University(西江大学) KAIST(韩国科学技术院) NYU Shanghai(上海纽约大学) JIUTIAN Research, China Mobile(中国移动九天研究院) The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Central Conservatory of Music(中央音乐学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。

Comments 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17812 2026-08-19 cs.MM 新提交 57%

On computational approaches to Pop music culture

流行音乐文化的计算研究方法

Arthur Flexer

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM

AI总结 该文提出流行音乐文化的计算研究需采用多模态方法,综述相关量化研究并指出其存在的多模态方法匮乏等问题,勾勒出绘制歌词主题图谱等三个未来研究方向。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06505 2026-08-19 cs.CL 版本更新 57%

Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning

在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐

Yuchen Zhang, Haralambos Mouratidis, Ravi Shekhar

机构 * Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学) School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出一种基于对比学习的多语言语音识别框架,通过语境对齐提升识别性能,支持多种语言和口音,实现语音与上下文的高效交互。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2608.17084 2026-08-19 cs.CL 新提交 87%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 85%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15455 2026-08-19 cs.MM cs.AI 版本更新 81%

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

M3TR: 增强型多模态微视频流行度预测框架

Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen's University Belfast(女王大学贝尔法斯特分校) Purdue University(普渡大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 M3TR通过结合精细时序建模与新颖的时序感知检索过程,提升微视频流行度预测的准确性与长期预测能力。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16972 2026-08-19 cs.LG 新提交 78%

MultiSigBERT: Beyond Survival Analysis through Multimodal and Sequential Modeling in Oncology

MultiSigBERT:肿瘤学中超越生存分析的多模态与序列建模

Paul Minchella, Stéphane Chrétien, Guillaume Metzler, Loïc Verlingue, Rémi Vaucher

机构 * Université Lumière Lyon 2(里昂第二大学) Léon Bérard Center(莱昂·贝拉尔中心) EPITA(EPITA(法国高等计算机与技术学院))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究提出基于路径特征表示的多模态序列生存建模框架MultiSigBERT,结合电子健康记录的多模态数据与时间特性,在含2500余名患者的肿瘤队列上取得0.743的一致性指数,提升了生存预测性能。

Comments Accepted at ECML PKDD 2026, Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 62%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17013 2026-08-19 cs.CV 版本更新 57%

Toward Universal Skeleton-Based Action Recognition across Heterogeneous Skeletons and Open Vocabularies

迈向通用的基于骨骼的动作识别

Jidong Kuang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01460 2026-08-19 cs.CV 版本更新 57%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17651 2026-08-19 astro-ph.HE 新提交 50%

Revisiting neutrino event epochs for the blazar PKS 0735+178 with TESS

利用TESS重新研究耀变体PKS 0735+178的中微子事件时期

Shubham Kishore, Alok C. Gupta, Debanjan Bose

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文利用TESS观测耀变体PKS 0735+178的周级耀发,分析其光学光变特性,探讨该源光学变异性与同期中微子事件的可能关联,为其光学流量行为提出物理场景。

Comments Accepted for publication in ApJ, 13 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23037 2026-08-19 cs.LG physics.flu-dyn 版本更新 50%

Open datasets and machine learning for two-phase heat transfer: a review following a spatial-temporal taxonomy

用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

Christy Dunlap, Ridwan Olabiyi, Firas Al-Hindawi, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, Ashif Iquebal, Han Hu

机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文介绍了一个由NED3实验室开发的开放多模态数据集和开源软件生态系统,提出了空间加时间维度(S+TD)分类框架,并重点描述了SeqReg序列回归库,以推动可复现的AI赋能热流体研究。

Comments Accepted manuscript replacing arXiv:2605.23037 (https://arxiv.org/abs/2605.23037) (v1). Substantially expanded from the original preprint and published in Transport Phenomena 2026, 1(3), 20260081. this https URL (https://doi.org/10.1515/tp-2026-0081)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 8 篇

2608.02148 2026-08-19 cs.IR cs.CL cs.CV 版本更新 86%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16929 2026-08-19 cs.LG 新提交 78%

Mr.Dec: Daily-Scale Longitudinal Multimodal Modeling for 30-Day Readmission Prediction

Mr.Dec:用于30天再入院预测的日尺度纵向多模态建模

Minjun Kim, Jong Hak Moon

机构 * Yeji X

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本研究提出Mr.Dec模型,通过Transformer解码器整合每日EHR与CXR数据,结合疾病特异性监督对比学习,在MIMIC-IV等数据集上实现30天再入院预测的SOTA性能,还可识别住院关键天数提供临床解释。

Comments MICCAI 2026 MultiTab Workshop Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18255 2026-08-19 eess.SP 版本更新 78%

WiFo-MiSAC: A Wireless Foundation Model for Multimodal Sensing and Communication Integration via Synesthesia of Machines (SoM)

WiFo-MiSAC:一种无线基础模型,通过机器的通感(SoM)实现多模态感知与通信的整合

Xuanyu Liu, Shijian Gao, Boxun Liu, Xiang Cheng, Liuqing Yang

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)

AI总结 WiFo-MiSAC通过统一空间的自监督预训练,解决通信与传感数据碎片化处理导致的泛化问题,采用共享-特定解耦的混合专家架构,实现多模态交互,实验表明其在多任务中表现优异,具备强大的少样本适应与新模态集成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST 新提交 71%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 跨模态检索 :multimodal(title)

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-19 cs.CV cs.CL 版本更新 62%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

Lingkai Bu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Jinyi Liang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17906 2026-08-19 cs.AI cs.MA 新提交 57%

AutoResearch: Insight In, Hallucination Out

AutoResearch:输入洞见,输出无幻觉

Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang

机构 * EvoMap(伊沃地图)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17144 2026-08-19 cs.HC 新提交 50%

Health Inquiry with AI: How Empathetic Expression and Conversational Contexts Shape Users' Communicative Acts

AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为

Xi Zheng, Xuyu Yang, Can Liu, Yuhan Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。

Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-19 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 11 篇

2608.17164 2026-08-19 cs.LG 新提交 83%

SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version

SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版

Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu

机构 * VinUniversity FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) VNU University of Engineering and Technology(VNU工程技术大学) Aalborg University(奥尔堡大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。

Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17564 2026-08-19 cs.CV cs.AI 新提交 81%

Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models

新概念必须进入之处:统一多模态模型中的入口门跨任务可用性

Zongyang Qiu, Yihan Wu, Kaixuan Fan, Bo Li, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Columbia University(哥伦比亚大学) CUHK(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究通过分离统一多模态模型的理解与生成任务方向,发现跨任务可用性取决于概念绑定的入口层,提出的对齐目标可在极低损失下实现概念跨任务迁移。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 79%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15517 2026-08-19 cs.CV 版本更新 79%

GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning

GLaQ:基于视觉证据的潜在查询定位用于多模态推理

Zesheng Yang, Lingling Zhang, Xinyu Zhang, Cheng Zhang, Pengyu Li, Heng Wang, Lin Wu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12982 2026-08-19 cs.AI cs.MA cs.SC 版本更新 79%

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

形式分析几何:一种基于神经符号的多模态解析几何问题生成框架

Ruoran Xu, Wending Gao, Xiaoqing Kang, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏