arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-29 至 2026-06-29 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2606.28266 2026-06-29 cs.CV 新提交 74%

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 62%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28273 2026-06-29 cs.CL 新提交 57%

Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models

视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

Niclas Lietzow, Danielle Bitterman, Carsten Eickhoff, William Rudman, Michal Golovanevsky

机构 * University of Tübingen(图宾根大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。

Comments 14 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11266 2026-06-29 cs.CV 版本更新 57%

GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving

GraphPilot: 基于场景图条件化的语言自主驾驶

Fabian Schmidt, Markus Enzweiler, Abhinav Valada

机构 * Esslingen University of Applied Sciences(埃斯林根应用科学大学) University of Freiburg(弗赖堡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出GraphPilot方法,通过交通场景图序列化与结构化提示模板,将关系上下文注入语言驾驶模型,显著提升驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 82%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 57%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27380 2026-06-29 cs.CL 新提交 57%

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

自动演讲辅导系统综述:系统、方法与开放挑战

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司) RoleGaku

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述自动演讲辅导系统,提出五维任务分类法,覆盖发音、韵律、节奏和内容忠实度,并分析TTS示例生成与诊断方法,指出语料稀缺、口音公平和低延迟诊断等挑战。

Comments accepted into the BEA 2026 workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 12 篇

2603.18558 2026-06-29 cs.CV cs.AI 版本更新 91%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00705 2026-06-29 cs.CV 版本更新 84%

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

无训练不确定性引导的复杂视觉任务多模态大语言模型

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03401 2026-06-29 cs.HC cs.AI cs.CV 版本更新 81%

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

LLMs能否进行注意力推理?多模态课堂行为的零样本分析

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit

机构 * Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。

Comments 8 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28089 2026-06-29 cs.CV 新提交 79%

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

RPM-Distill:生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

机构 * McGill University(麦吉尔大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出RPM-Distill框架,利用训练时的雷达信号通过频域蒸馏指导视频模型,提升光照、肤色和运动变化下的远程心率估计鲁棒性,在挑战性条件下MAE降低81%,相关性提升21%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27576 2026-06-29 cs.CV 新提交 79%

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

DeLux: 利用神经形态数据进行视频中的跨模态局部伪影修复

Bartosz Stachowiak, Dariusz Brzezinski

机构 * Institute of Computing Science, Poznan University of Technology(波兹南技术大学计算机科学学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出DeLux,一种利用神经形态事件流作为结构先验,引导RGB视频中光照伪影检测与修复的跨模态修复方法,在合成和真实数据上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 77%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 视频多模态 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 67%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交 57%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24253 2026-06-29 cs.CV 新提交 57%

TuringViT: Making SOTA Vision Transformers Accessible to All

TuringViT:让最先进的视觉Transformer人人可用

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20328 2026-06-29 cs.CV 版本更新 57%

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

混合潜在推理与解耦策略优化

Tao Cheng, Shi-Zhe Chen, Hao Zhang, Yixin Qin, Jinwen Luo, Zheng Wei

机构 * Tencent PCG(腾讯PCG) Tencent CSIG(腾讯CSIG)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。

Comments Accepted to ECCV 2026

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00784 2026-06-29 cs.CV 版本更新 57%

An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models

一种丰富手术视频数据集的方法,用于视觉-语言模型的细粒度时空理解

Lennart Maack, Alexander Schlaefer

机构 * Hamburg University of Technology(汉堡理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SurgSTU-Pipeline生成管道,通过时空连续性过滤创建细粒度时空问答数据集SurgSTU,提升视觉-语言模型在手术视频中的时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02340 2026-06-29 cs.AI q-bio.OT 版本更新 57%

Chronic Kidney Disease Prognosis Prediction Using Transformer

使用Transformer进行慢性肾脏病预后预测

Yohan Lee, Dong Gyun Kang, SeHoon Park, Sa-Yoon Park, Kwangsoo Kim

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2606.27831 2026-06-29 cs.CV cs.AI 新提交 62%

Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modeling

Hippocampus-DETR: 基于海马体建模的显式记忆目标检测框架

Zhaoning Shi, Bo Ma, Hao Xu, Zepeng Yang, Bo Liang

机构 * Beijing institute of Technology(北京理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对目标检测模型缺乏显式记忆机制的问题,提出Hippocampus-DETR框架,通过模拟海马体亚区结构实现模式分离与补全,提升检测精度及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27794 2026-06-29 cs.CV 新提交 57%

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

文本作为照明:面向语言引导医学图像分割的空间对比度Retinex学习

Jian Shi, Cheng Zhen, Pingping Zhang, Rui Xu, Yanan Lv, Yili Ma, Huan Bi, Haojie Li, Huchuan Lu

机构 * School of Software Technology & DUT-RU International School of Information Science and Engineering, Dalian University of Technology(大连理工大学软件学院 & 大连理工大学-俄罗斯国际信息科学与工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) Central Hospital of Dalian University of Technology(大连理工大学中心医院) Cancer Hospital of Dalian University of Technology(大连理工大学肿瘤医院) College of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出TIRNet框架,将文本嵌入作为语义照明调制特征,通过Retinex启发模块和对比损失实现语言与分割的精确对齐,在MosMedData+和QaTa-COV19数据集上取得最优性能。

Comments Aceepted by MICCAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2507.05503 2026-06-29 cs.CE 版本更新 78%

MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design

MolFORM:基于多模态流匹配的结构药物设计

Jie Huang, Daiheng Zhang

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 提出MolFORM框架,利用多流匹配联合建模离散原子类型和连续3D坐标,并通过基于直接偏好优化的偏好引导微调提升生成质量,在多个评估指标上取得一致改进。

Comments Accepted to ICML 2025 genbio workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 77%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27923 2026-06-29 cs.CV cs.AI 新提交 62%

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, Yindong Kong, Jing Li, Qi Wu, Feng Zhang, Jianan Jiang, Ruigao Yang

机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。

Comments 18 pages, 10 figures, 2 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 62%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27766 2026-06-29 cs.LG cs.AI cs.RO 新提交 57%

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

RS-Diffuser: 基于分布价值引导的风险敏感扩散规划

Shiqiang Gong

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出RS-Diffuser,一种结合扩散轨迹生成与分布价值评论家的风险敏感离线规划框架,通过尾部感知目标引导去噪过程,实现灵活的风险偏好行为,在风险敏感D4RL和机器人导航基准上达到最优性能。

Comments ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交 57%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25042 2026-06-29 cs.CV 版本更新 57%

Unbiased Diffusion Variational Inversion via Principled Posterior Matching

无偏扩散变分反演:基于原则性后验匹配

Weimin Bai, Yuxuan Gu, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出原则性后验匹配(PPM)框架,通过精确优化KL散度(利用Fisher散度积分)解决逆问题中模式坍塌和不确定性量化不可靠的问题,统一变分推理和摊销推理,在图像修复、超分辨荧光显微和射电干涉成像中实现高保真重建和校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10863 2026-06-29 cs.CV 版本更新 57%

Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding

超越序列距离:模态间距离不变位置编码

Lin Chen, Bolin Ni, Qi Yang, Zili Wang, Kun Ding, Ying Wang, Houwen Peng, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(MAIS,自动化研究所,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Tencent Hunyuan Team, China(腾讯文言团队,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在长上下文中的视觉衰减问题,提出模态间距离不变位置编码(DIPE),通过解耦模态间位置编码消除距离惩罚,保持视觉感知一致性,显著缓解视觉衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏