arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-25 至 2026-05-25 共收录 66 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2605.23482 2026-05-25 cs.CV cs.AI 89%

Multimodal Distribution Matching for Vision-Language Dataset Distillation

多模态分布匹配用于视觉-语言数据集蒸馏

Jongoh Jeong, Hoyong Kwon, Minseok Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(韩国科学技术院视觉智能实验室)

专题命中 图文多模态 :multimodal(title,summary_cn);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出多模态分布匹配(MDM)框架,通过数据、模型和损失层面的几何感知组件,高效压缩视觉-语言数据集并保持跨模态对齐。

Comments Accepted for publication at CVPR 2026. Project Page: https://andyj1.github.io/mdm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09349 2026-05-25 cs.CV cs.AI cs.CL 82%

Visually-Guided Policy Optimization for Multimodal Reasoning

视觉引导的多模态推理策略优化

Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) SYSU(南方科技大学) BUPT(北京邮电大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。

Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22902 2026-05-25 cs.LG cs.AI cs.CL 73%

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Transcoders 追踪视觉语言模型中的视觉基础与幻觉

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

机构 * Institute of Language and Speech Processing(语言与语音处理研究所) Athena Research Center(雅典研究中心)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23165 2026-05-25 cs.RO cs.AI cs.CL 62%

Autonomous Frontier-Based Exploration with VLM Guidance

基于自主前沿探索与VLM引导

Aarush Aitha, Avideh Zakhor

机构 * EECS Department, University of California(加州大学EECS系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。

Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19859 2026-05-25 cs.CV 57%

Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models

Eyes on VLM: 视觉语言模型中注视跟随与社会性注视预测的基准测试

Hengfei Wang, Anshul Gupta, Pierre Vuillecard, Jean-Marc Odobez

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EyeVLM评估框架,通过零样本和微调方式测试视觉语言模型在注视跟随(几何视觉处理)和社会性注视预测(社交推理)两个核心任务上的能力,发现当前VLM缺乏精确的注视理解能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2605.23113 2026-05-25 cs.CV 85%

Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization

不一致感知多模态薛定谔桥用于深度伪造定位

Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue

机构 * Department of Computer Science and Techonology, Huaqiao University(华侨大学计算机科学与技术系) Xiamen Key Laboratory of Computer Vision and Pattern Recognition, Huaqiao University(厦门计算机视觉与模式识别重点实验室) Tongji University(同济大学) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出IaMSB框架,利用薛定谔桥统一一致性估计、跨模态信息选择和桥步调度,实现高精度区间级深度伪造定位。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19858 2026-05-25 cs.CL 57%

Benchmarking Gaslighting Attacks Against Speech Large Language Models

针对语音大语言模型的气灯攻击基准测试

Jinyang Wu, Bin Zhu, Xiandong Zou, Qiquan Zhang, Xu Fang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) Tongyi Speech Lab(通义语音实验室) Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 提出五种气灯攻击策略(愤怒、认知干扰、讽刺、隐晦、专业否定),在5个语音和多模态大语言模型上测试,发现平均准确率下降24.3%,揭示语音模型的行为脆弱性。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23463 2026-05-25 eess.AS 57%

StepAudio 2.5 Technical Report

StepAudio 2.5 技术报告

Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao, Daijiao Liu, Fei Tian, Feng Tian, Haiyang Sun, Haoyang Zhang, Jiangjie Zhen, Jinglan Gong, Jun Chen, Li Xie, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Runze Li, Shenghua Hu, Siyi Zhou, Wenwen Qu, Xiangyu Li, Xiangyu Tony Zhang, Xuerui Yang, Yang Yang, Yechang Huang, Yu Fu, Yuchu Luo, Yuxin Li, Yuxin Zhang, Zhengyan Sheng, Brian Li, Chang Zeng, Changlin Zhang, Chen Geng, Chenghao Dong, Chengli Feng, Dan Zhou, Danni Wan, Di Chen, Die Zhang, Dongqing Pang, Guanglong Yang, Guoqiang Hu, Huangxi Zhu, Jianzheng Gao, Jinghua Liang, Jinmei Wan, Junjie Yuan, Kang An, Lei Lei, Limin Zhong, Lun Cai, Mengqiang Ren, Min Xu, Mingliang Li, Mingxiao Li, Na Wang, Qiang Tong, Qiaoling Huang, Qingfu Du, Rui Wang, Shengchen Zhou, Shi Qiu, Shihao Peng, Shiliang Yang, Siqi Tu, Tianjiao Deng, Ting Xu, Tong Wang, WeiMing Niu, Wuxun Xie, Xianwei Zhang, Xianyu Feng, Xiaojia Liu, Xing Chen, Xiongbin Wu, Yan Wu, Yang Li, Yi Liu, Yifan Zhang, Yile Liu, Yongshen Long, Yu Luo, Yuanhao Ding, Yuhao Wang, Yuhe Yin, Yunfang Xu, Yuxiang Yang, Zhiguo Huang, Zhiyue Wu, Zichao Li, Zichao Zhou, Daxin Jiang, Future Li, Gang Yu, Xiangyu Zhang, Yibo Zhu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2605.17468 2026-05-25 cs.HC cs.AI 79%

An Interpretable Closed-Loop Intelligent Tutoring System for Multimodal Affective Feedback in Asynchronous Presentation Training

一种可解释的闭环智能辅导系统,用于异步演讲训练中的多模态情感反馈

Hung-Yue Suen, Kuo-En Hung

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于XGBoost的可解释闭环智能辅导系统,通过三层可解释反馈架构将多模态输入映射为可追溯的反馈,在MOOC视频上训练并验证了其提升演讲技能的有效性。

Comments 12 pages, 8 figures, IEEE Transactions on Learning Technologies, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19995 2026-05-25 cs.CV 79%

A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement

短视频多模态特征中信息感知价值的计算模型预测感官与行为参与

Haoning Xue, Jingwen Zhang, Xiaohui Wang, Diane Dagyong Kim, Yunya Song

机构 * Department of Communication, University of Utah(犹他大学通讯系) Department of Communication, University of California, Davis(加州大学戴维斯分校通讯系) Department of Media and Communication, City University of Hong Kong(香港城市大学媒体与传播系) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科学与技术大学新兴跨学科领域 division)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 基于信息感知价值理论,通过多模态特征分析和人工评估构建计算模型,预测短视频的感官与行为参与,发现MSV与感官参与正相关,与行为参与呈倒U型关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 62%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07399 2026-05-25 cs.AI cs.CV 62%

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

VGAS: 价值引导的动作块选择用于少样本视觉-语言-动作适应

Changhua Xu, En Yu, Junyu Xuan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VGAS框架,通过生成-选择范式和价值引导的动作块选择,解决少样本VLA适应中的几何歧义问题,提升成功率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23274 2026-05-25 cs.CV 57%

U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025

U-CESE:面向AI挑战赛胡志明市2025的统一基于片段的事件搜索引擎

Duc-Nhuan Le, Hoang-Phuc Nguyen, Thanh-Duy Lam, Minh-Nhut Dang, Minh-Hoang Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出U-CESE框架,通过统一剪辑算法、轻量级关键帧提取方法DAKE和时序一致字幕生成ReCap,实现大规模视频多模态事件检索。

Comments Accepted for publication in the Proceedings of the 14th International Symposium on Information and Communication Technology (SOICT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22962 2026-05-25 cs.CV cs.CE cs.HC cs.SE q-bio.NC 57%

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction

凝视行为注释工具包 (GBAT): 基于AI的自动注释工具,用于自我中心眼动追踪和儿童-照顾者互动视频数据

Iba Baig, Kevin Li, Yanbin Xu, Seiji Cattelain, Marie Hallo, Hayato Ono, Sho Tsuji, Ming Bo Cai

机构 * Department of Psychology, University of Miami(迈阿密大学心理学系) Northeastern University(东北大学) Ecole Normale Supérieure, PSL University, EHESS, CNRS(巴黎高等师范学院(PSL大学)、EHESS、CNRS) International Research Center for Neurointelligence (WPI-IRCN), The University of Tokyo Institutes for Advanced Study(神经智能国际研究中心(WPI-IRCN)、东京大学高级研究机构)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出GBAT工具包,利用深度学习实现多视频同步、注视目标半自动注释和参与者姿态手部动作分类,提高从自我中心眼动和视频数据中提取特征的效率和可扩展性。

Comments submitted to IEEE International Conference on Development and Learning (ICDL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06885 2026-05-25 cs.CV 57%

Time-driven Survival Analysis from FDG-PET/CT in Non-Small Cell Lung Cancer

基于FDG-PET/CT的非小细胞肺癌时间驱动生存分析

Sambit Tarai, Ashish Chauhan, Elin Lundström, Johan Öfverstedt, Therese Sjöholm, Veronica Sanchez Rodriguez, Håkan Ahlström, Joel Kullberg

机构 * Radiology, Department of Surgical Sciences(外科科学系放射学部) Antaros Medical(Antaros医疗) Molecular Imaging and Medical Physics, Department of Surgical Sciences(外科科学系分子成像与医学物理部)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种结合组织FDG-PET/CT投影和时间输入的深度学习回归框架,用于预测非小细胞肺癌患者的总生存期,在AUC上比基线方法提升4.3%,并实现了风险分层。

Comments Under review

Journal ref Ann Biomed Eng (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23598 2026-05-25 cs.CR cs.HC 50%

When Youth Enter the Algorithmic Wild: Discovering and Understanding Potentially Harmful Teen Videos on Douyin and Kwai

当青少年进入算法荒野:发现和理解抖音和快手上的潜在有害青少年视频

Shaoxuan Zhou, Yafei Sun, Jing Zhang, Xianghang Mi

专题命中 视频多模态 :multimodal(abstract)

AI总结 通过行为测量框架PHTV-Scout,结合离线调查与在线管道,发现抖音和快手上6.11%的视频为潜在有害青少年视频,其中儿童性剥削图像占53.2%,且有害内容通过隐蔽交互和主动规避策略传播,而青少年模式虽能完全屏蔽但采用率低。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2508.10016 2026-05-25 cs.CL 85%

Training-Free Multimodal Large Language Model Orchestration

免训练的多模态大语言模型编排

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22833 2026-05-25 cs.IR cs.AI cs.LG 79%

RAG4Outcome: A Retrieval-Augmented Multimodal Framework for Prognostic Prediction in Chronic Osteomyelitis

RAG4Outcome:用于慢性骨髓炎预后预测的检索增强多模态框架

Daqian Shi, Pei Han, Jishizhan Chen, Yang Wang, Xiaolei Diao, Xianyou Zheng, Pengfei Cheng

机构 * Queen Mary University of London(女王玛丽大学) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) University College London(大学学院伦敦)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出RAG4Outcome框架,通过检索增强生成技术融合PET-CT影像报告、结构化手术诊断记录和非结构化随访笔记等多模态临床数据,实现慢性骨髓炎的预后预测,提高可解释性和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22829 2026-05-25 cs.IR cs.AI 79%

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

LFRAG:面向布局的多模态文档理解中的细粒度检索增强生成

Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Zhejiang University Institute of Blockchain and Data Security(杭州高新技术区(滨江)浙江大学区块链与数据安全研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出LFRAG框架,通过布局分割和语义-布局融合编码器实现从页面级到块级的细粒度检索,提升多模态文档检索精度并减少生成冗余,在LFDocQA基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23344 2026-05-25 cs.CV cs.AI 62%

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

CHASD:面向LVLMs中幻觉的语言增量校准对比解码

Xiaoyi Huang, Kejia Zhang, Zhiming Luo

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出CHASD框架,通过不确定性驱动的置信门控和注意力引导的局部扰动,在推理时按需校准对比解码,减少对象幻觉并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23310 2026-05-25 cs.IR 50%

From Head to Tail: Asymmetric Knowledge Transfer in Long-tail Recommendation with Generative Semantic IDs

从头到尾:利用生成式语义ID进行长尾推荐中的非对称知识迁移

Chenyi Yan, Ruocong Tang, Xing Fang, Yang Huang, He Guo, Jing Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 针对长尾推荐中的数据不平衡问题,提出AKT-Rec框架,利用多模态大模型生成语义ID,通过聚类引导的自适应嵌入和层次化特征聚合实现从头到尾的非对称知识迁移,在工业数据集和在线A/B测试中显著提升性能。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 11 篇

2605.23780 2026-05-25 cs.AI 79%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 75%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12455 2026-05-25 cs.CV 70%

Mitigating Object Hallucinations via Sentence-Level Early Intervention

通过句子级早期干预缓解对象幻觉

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11146 2026-05-25 cs.CV cs.AI 62%

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

超越基于VLM的奖励:扩散原生潜在奖励建模

Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

机构 * The Hong Kong University of Science Huawei Hong Kong AI Framework \& Data Technologies Lab Tsinghua University The Australian National University

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。

Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23406 2026-05-25 cs.CV 57%

RS2AD-LiDAR: End-to-End Autonomous Driving LiDAR Data Generation from Roadside Sensor Observations

RS2AD-LiDAR:基于路侧传感器观测的端到端自动驾驶LiDAR数据生成

Runyi Huang, Ni Ding, Ruidan Xing, Yuheng Shi, Lei He, Keqiang Li

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility(智能绿色车辆与移动国家重点实验室) School of Vehicle and Mobility(车辆与移动学院) College of Artificial Intelligence(人工智能学院) Logic & Silicon AI Studio School of Instrumentation and Optoelectronic Engineering(仪器科学与光电工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出RS2AD-LiDAR框架,通过坐标变换、虚拟LiDAR建模和点云重采样技术,从路侧LiDAR点云生成车载LiDAR数据,解决数据获取成本高和场景稀缺问题,并验证生成数据对BEV和3D检测的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23178 2026-05-25 cs.CV 57%

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

将人物组合在一起:面向多人交互场景的迭代姿态-图像生成

Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种双姿态-图像表示方法,将人物结构先验引入预训练扩散Transformer,通过跨模态对齐和迭代场景构建,提升多人交互图像生成的提示对齐度和场景多样性。

Comments Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21487 2026-05-25 cs.CV 57%

Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning

Uni-Edit: 智能编辑作为统一模型调优的通用任务

Dian Zheng, Manyuan Zhang, Hongyu Li, Hongbo Liu, Kai Zou, Kaituo Feng, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Meituan(美团) TJU(天津大学) USTC(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出将智能图像编辑作为统一多模态模型调优的通用任务,通过单一任务、单阶段训练和单一数据集同时提升图像理解、生成和编辑能力,并引入自动化数据合成流水线构建推理密集型指令数据集Uni-Edit-148k。

Comments Project Page: https://zhengdian1.github.io/Uni-Edit-proj/ Code: https://github.com/zhengdian1/Uni-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00560 2026-05-25 cs.RO cs.CV 57%

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving

使用集成扩散估计端到端自动驾驶的不确定性

Florian Wintel, Sigmund H. Høeg, Gabriel Kiss, Frank Lindseth

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出EnDfuser系统,利用扩散模型作为轨迹规划器,通过集成扩散从单一感知帧生成候选轨迹分布,实现不确定性感知决策,在LAV基准上驾驶评分提升1.7%。

Comments Accepted at NLDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17119 2026-05-25 cs.LG cs.AI 57%

Diffusion and Flow Matching Models for Tabular Data: A Survey

表格数据的扩散与流匹配模型:综述

Zhong Li, Qi Huang, Lincen Yang, Jiayang Shi, Zhao Yang, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen

机构 * Great Bay University(大湾大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) LIACS, Leiden University(莱顿大学LIACS)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文系统综述了扩散模型和流匹配模型在表格数据生成、缺失值填补、可信数据生成和异常检测等任务中的应用,分析了数据工程挑战、设计选择、评估维度及开放问题。

Comments We substantially updated the previous version "Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions" by including flow matching models for tabular data

详情

展开后加载摘要…

URL PDF HTML 收藏