arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-17 至 2026-06-17 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2606.17809 2026-06-17 cs.CV 新提交 79%

Million-scale multimodal pollen microscopy with expert-guided foundation models

百万级多模态花粉显微镜图像与专家引导的基础模型

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

机构 * Department of Physics of Complex Systems, ELTE Eötvös Loránd University(ELTE罗兰大学复杂物理系) The Palynological Laboratory at the Swedish Museum of Natural History(瑞典自然历史博物馆孢粉学实验室) National Centre for Public Health and Pharmacy(国家公共卫生与药品中心) INRAE, UR 546 BioSP, Site Agroparc(法国国家农业、食品与环境研究院,UR 546 BioSP,阿格罗帕克园区) National Korányi Institute for Pulmonology(国家科拉尼肺病研究所) Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University(塞梅维什大学健康与公共管理学院卫生服务管理培训中心健康数据科学与人工智能知识中心) Department of Biological Physics, ELTE Eötvös Loránd University(ELTE罗兰大学生物物理系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出百万级多模态花粉显微镜数据集Pollen AI Atlas,结合专家引导的视觉-语言模型生成形态描述,实现跨区域、跨设置的高精度花粉识别与检索。

Comments 31 pages, 5 main figures, supplementary information included. Submitted to Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17389 2026-06-17 cs.CV cs.AI cs.CL cs.LG 新提交 76%

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性

Logan Mann, Yi Xia, Ajit Saravanan, Ishan Dave, Saadullah Ismail, Shikhar Shiromani, Emily Huang, Ruizhe Li, Kevin Zhu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Algoverse AI Research(Algoverse AI研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multimodal(abstract,comments);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。

Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18746 2026-06-17 cs.CV 版本更新 57%

Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification

通过闭环视觉基础验证弥合自我反思中的模态脱节

Haoyu Zhang, Yuwei Wu, Pengxiang Li, Xintong Zhang, Zhi Gao, Rui Gao, Mingyang Gao, Che Sun, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 10 篇

2606.17800 2026-06-17 cs.CV 新提交 83%

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

MaineCoon: 追求实时音视频社交世界模型

Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie

机构 * Catnip AI Team(Catnip AI团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。

Comments 32 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19697 2026-06-17 eess.AS cs.MM cs.SD 版本更新 81%

Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction

Plug-and-Steer:解耦分离与选择的音视频目标说话人提取

Doyeop Kwak, Suyeon Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 提出Plug-and-Steer方法,通过解耦分离与目标选择,利用冻结的纯音频骨干网络和潜引导矩阵实现高保真音视频目标说话人提取。

Comments Accepted by Interspeech 2026; demo available https://plugandsteer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17254 2026-06-17 eess.AS 新提交 79%

Synergizing Zero-Shot Cross-Lingual Alzheimer Detection with Language-Invariant Multimodal Bi-Geometric Adversarial Learning

协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习

Girish, Mohd Mujtaba Akhtar, Farhan Sheth, Muskaan Singh, Juliana Gerard, Paula McClean, Kongfatt Wong-Lin

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17281 2026-06-17 cs.CL cs.SD eess.AS 新提交 76%

Are you speaking my languages? On spoken language adherence in multimodal LLMs

你在说我的语言吗?多模态大语言模型中的口语遵循问题

Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic

机构 * Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、eess.AS

AI总结 针对多模态大语言模型在自动语音识别中输出语言识别错误的问题,提出软提示方法、监督微调和思维链推理三种缓解策略,并引入新指标量化语言违背,比较各方法在减少违规和保持ASR性能上的效果。

Comments 7 pages, 3 tables in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17542 2026-06-17 cs.CL 新提交 70%

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力

Ryo Fukuda, Takatomo Kano, Siddhant Arora, Marc Delcroix, Naohiro Tawara, Atsunori Ogawa, Yuya Chiba, Atsushi Ando, William Chen, Shinji Watanabe

机构 * NTT, Inc., Japan(日本电信电话公司) Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28378 2026-06-17 cs.SD cs.AI 版本更新 70%

Membership Inference Attacks against Large Audio Language Models

针对大型音频语言的成员推断攻击

Jia-Kai Dong, Yu-Xiang Lin, Hung-Yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能卓越研究中心)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 首次系统评估大型音频语言模型的成员推断攻击,提出盲基线协议控制分布偏移,发现跨模态记忆仅源于说话人声纹与文本绑定。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19937 2026-06-17 cs.CL cs.SD eess.AS 版本更新 62%

ALAS: An Automatic Latent Alignment Score for Audio Language Models

ALAS:音频语言模型的自动潜在对齐分数

Pooneh Mousavi, Yingzhi Wang, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(Concordia 大学) Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) Centrale Supelec(Centrale Supelec 研究院) Laval University(Laval 大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16009 2026-06-17 cs.CL cs.HC 新提交 57%

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

弥合可用性差距:口译研究对机器口译设计的启示

Claudio Fantinuoli

机构 * University of Mainz(美因茨大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文定义机器口译为语音翻译的子领域,指出其存在“准确性幻觉”,并借鉴口译研究提出未来设计的三个优先方向:能动性、共同基础与体验,以弥合可用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17736 2026-06-17 q-bio.NC 新提交 50%

Ten Years of the Stochastic Resonance Model of Tinnitus: From Phantom Perception to Adaptive Sensory Optimization

耳鸣的随机共振模型十年:从幻想到自适应感觉优化

Patrick Krauss, Achim Schilling

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文综述了耳鸣的随机共振模型,该模型将耳鸣重新解释为听觉系统为补偿听力损失而自适应上调神经噪声的副产品,并总结了理论、实验和临床应用进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18228 2026-06-17 cs.HC 新提交 50%

MAJIC: Leveraging Articulatory Motion for Speech-based Emotion Recognition

MAJIC: 利用发音运动进行基于语音的情感识别

Tanmay Srivastava, Paras Bhavnani, Benjir Alvee Islam, Shubham Jain

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出MAJIC多模态情感识别系统,通过融合下颌和面部肌肉的发音运动特征与音频特征,在多种语言和场景下实现93%准确率和91%F1分数,优于纯音频基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2507.14632 2026-06-17 cs.CV 版本更新 91%

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

BusterX++: 迈向基于MLLM的统一跨模态AI生成内容检测与解释

Haiquan Wen, Tianxiao Li, Zhenglin Huang, Yiwei He, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学)

专题命中 视频多模态 :MLLM(title,title_cn);cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出统一多模态大模型BusterX++,通过纯强化学习策略实现图像与视频伪造检测的跨模态能力迁移,性能超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16978 2026-06-17 cs.CV 版本更新 85%

A Benchmark for Omni-Modal Reasoning in Long Videos

长视频全模态推理基准

Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou, Sahal Shaji Mullappilly, Mohammad Almansoori, Noor Ahsan, Beknur Kalmakhanbet, Sambal Shikhar, Rishabh Lalla, Jean Lahoud, Mariette Awad, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) American University of Beirut(贝鲁特美国大学) Linköping University(利尔贝里大学)

专题命中 视频多模态 :omni-modal(title,abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CV

AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12899 2026-06-17 eess.SP 新提交 50%

LGVSC: A Large-Model-Driven Generative Video Semantic Communication Framework

LGVSC:一种大模型驱动的生成式视频语义通信框架

Yu Ma, Hang Yin, Li Qiao, Shuo Sun, Zhen Gao, Yin Xu, Wenjun Zhang

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出大模型驱动的生成式视频语义通信框架LGVSC,通过解耦编解码器、引入概率语义相似度评分和语义引导关键帧提取,在极低带宽下实现高效视频语义传输,并保持零样本泛化能力。

Comments Accepted by IEEE Transactions on Vehicular Technology; v2: Added appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27583 2026-06-17 q-bio.NC cs.RO 版本更新 50%

Simulating Infant First-Person Sensorimotor Experience via Motion Retargeting from Babies to Humanoids

通过从婴儿到类人机器人的运动重定向模拟婴儿第一人称感觉运动经验

Francisco M. López, Hoshinori Kanazawa, Ondrej Fiala, Yakov Balashov, Valentin Marcel, Lukas Rustler, Miles Lenz, Dongmin Kim, Yasuo Kuniyoshi, Jochen Triesch, Matej Hoffmann

机构 * German Research Foundation(德国研究基金会) Johanna Quandt foundation(约翰娜·克文特基金会) Czech Science Foundation(捷克科学基金)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出一种从单视频重建婴儿3D姿态并映射到物理/虚拟类人平台的方法,实现亚厘米级精度的多感觉流模拟,为发育研究和神经发育障碍早期检测提供新工具。

Comments Accepted at IEEE ICDL 2026. 8 pages, 6 figures. Cite as: F. M. López, H. Kanazawa, O. Fiala, Y. Balashov, V. Marcel, L. Rustler, M. Lenz, D. Kim, Y. Kuniyoshi, J. Triesch, and M. Hoffmann, "Simulating infant first-person sensorimotor experience via motion retargeting from babies to humanoids'', in 2026 IEEE International Conference on Development and Learning (ICDL). IEEE, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2606.17449 2026-06-17 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 81%

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

MODE-RAG: 基于流形异常诊断和能量的检索增强生成评估

Zehang Wei, Jiaxin Dai, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MODE-RAG多智能体系统,利用变分自由能和内部注意力状态动态门控干预,结合蒙特卡洛树搜索和logit扰动减少多模态检索增强生成中的幻觉和逻辑捏造。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03120 2026-06-17 cs.CV cs.RO 版本更新 57%

SCC-Loc: A Unified Semantic Cascade Consensus Framework for UAV Thermal Geo-Localization

SCC-Loc: 无人机热红外地理定位的统一语义级联共识框架

Xiaoran Zhang, Yu Liu, Jinyu Liang, Kangqiushi Li, Zhiwei Huang, Huaxin Xiao

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出SCC-Loc框架,通过共享DINOv2骨干网络、语义引导视口对齐、级联空间自适应纹理结构滤波和共识驱动可靠性感知位置选择,解决热红外-可见光模态差异导致的特征模糊问题,实现零样本高精度绝对位置估计,平均定位误差9.37米。

Comments 17 pages, 5 figures. Submitted to IEEE J-STARS

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2507.04704 2026-06-17 q-bio.QM cs.AI cs.CV 版本更新 81%

SPATIA: Multimodal Generation and Prediction of Spatial Cell Phenotypes

SPATIA: 空间细胞表型的多模态生成与预测

Zhenglun Kong, Mufan Qiu, John Boesen, Xiang Lin, Sukwon Yun, Tianlong Chen, Manolis Kellis, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学学校生物医学信息学系) Department of Computer Science, University of North Carolina(北卡罗来纳大学计算机科学系) Department of Computer Science, Massachusetts Institute of Technology(麻省理工学院计算机科学系)

专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出SPATIA模型,融合细胞形态、基因表达和空间上下文,通过置信感知流匹配和形态-谱对齐实现多尺度生成与预测,在12项任务中优于18个基线模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 79%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17213 2026-06-17 cs.CL cs.CV 新提交 62%

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

重新审视用于3D CT报告生成的LLM适应:缩放与诊断先验研究

Vanshali Sharma, Andrea M. Bejar, Halil Ertugrul Aktas, Quoc-Huy Trinh, Debesh Jha, Gorkem Durak, Ulas Bagci

机构 * Northwestern University(西北大学) University of South Dakota(南达科他大学) Aalto University(阿尔托大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出RAD3D-Prefix轻量级诊断先验框架,通过冻结大语言模型并融合多标签分类逻辑,在少量可训练参数下实现3D CT报告生成,优于全微调基线并展现强泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17057 2026-06-17 cs.LG cs.AI cs.CL 新提交 62%

Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

配对时正确,分离时错误:多模态大语言模型中模态特定神经元的解耦与编辑

Tingchao Fu, Wenkai Wang, Fanxiao Li, Huadong Zhang, Jinhong Zhang, Dayang Li, Yunyun Dong, Renyang Liu, Wei Zhou

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Software, Yunnan University(云南大学软件学院) National University of Singapore(新加坡国立大学) School of Engineering, Yunnan University(云南大学工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型知识编辑中存在的解耦失败问题,提出DECODE方法,通过显式解耦和定位模态特定神经元组,实现跨模态触发下的有效知识更新。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17742 2026-06-17 cs.CV q-bio.NC 新提交 57%

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics

BrainWorld:一种用于全脑4D fMRI动力学的结构先验条件生成模型

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Xuanye Pan, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainWorld模型,利用结构MRI作为解剖先验条件,通过去噪过程生成全脑4D fMRI动态,在22个数据集上稳定生成400帧轨迹,并通过生成样本增强提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17675 2026-06-17 cs.CV 新提交 57%

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation

我们真的需要扩散吗?用于配对医学图像翻译的快速U-Net

Alicia Pirwass, Birte Glimm, Michael Munz, Hans-Joachim Wilke

机构 * Institute of Artificial Intelligence, Ulm University(乌尔姆大学人工智能研究所) Institute of Orthopaedic Research and Biomechanics, Centre for Trauma Research, University Hospital Ulm(乌尔姆大学医院创伤研究中心骨科研究与生物力学研究所) AI for Sensor Data Analytics Research Group, Ulm University of Applied Sciences(乌尔姆应用科学大学传感器数据分析人工智能研究组)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文比较轻量级4级U-Net与去噪扩散概率模型(DDPM)在从T2加权MRI估计脂肪分数任务上的性能,发现U-Net在精度和速度上均优于DDPM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 57%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16449 2026-06-17 cs.CV 新提交 57%

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

PermaVid: 通过解耦上下文记忆实现编辑下的一致视频生成

Shuai Yang, Bingjie Gao, Ziwei Liu, Jiaqi Wang, Dahua Lin, Tong Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出PermaVid框架,利用解耦为语义外观和几何结构的上下文记忆,结合编辑感知更新策略,实现编辑操作后视频的长期一致生成。

Comments Project page: https://ys-imtech.github.io/projects/PermaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 57%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 18 篇

2505.12620 2026-06-17 cs.CV 89%

BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation

BusterX:基于MLLM的AI生成视频伪造检测与解释

Haiquan Wen, Yiwei He, Zhenglin Huang, Tianxiao Li, Zihan Yu, Xingru Huang, Lu Qi, Baoyuan Wu, Xiangtai Li, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University, SG(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, Guangdong, China(香港中文大学(深圳)) Wuhan University(武汉大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出BusterX,一种基于多模态大语言模型的视频伪造检测系统,通过改进数据集和评估基准,提升检测准确性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏