arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 110 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2604.03953 2026-04-07 cs.CV cs.LG 88%

Multimodal Structure Learning: Disentangling Shared and Specific Topology via Cross-Modal Graphical Lasso

多模态结构学习:通过跨模态图拉索解耦共享和特定拓扑

Fei Wang, Yutong Zhang, Xiong Wang

机构 * Stony Brook University(石溪大学) Sichuan University(四川大学) USTC(中国科学技术大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态图拉索方法,通过统一视觉语言编码器和跨注意力蒸馏机制,解耦共享与类别特定拓扑,提升多模态表征的可解释性。

Comments Submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 79%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04780 2026-04-07 cs.CV 79%

CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models

CLEAR: 解锁统一多模态模型中退化图像理解的生成潜力

Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang, Linhao Yu, Yao Chen, Yiqian Zhang, Haiyun Guo, Shuohuan Wang, Yu Sun

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 CLEAR通过三个步骤提升统一多模态模型在退化图像中的理解能力,包括监督微调、潜在表示桥梁和交错GRPO,增强模型在退化输入下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04608 2026-04-07 cs.CV 79%

Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection

超越语义:通过通用物理描述符揭示合成检测的物理本质

Mei Qiu, Jianqiang Zhao, Yanyun Qu

机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) Xia'men University(厦门大学)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04145 2026-04-07 cs.AI 79%

Solar-VLM: Multimodal Vision-Language Models for Augmented Solar Power Forecasting

Solar-VLM:用于增强太阳能发电预测的多模态视觉语言模型

Hang Fan, Haoran Pei, Runze Liang, Weican Liu, Long Cheng, Wei Wei

机构 * North China Electric Power University(华北电力大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Solar-VLM框架,通过融合时序观测、卫星图像和文本天气信息,提升太阳能发电预测的准确性,采用多模态编码器和图注意力网络捕捉空间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23095 2026-04-07 cs.CV 79%

Revisiting Multimodal Positional Encoding in Vision-Language Models

重新审视视觉-语言模型中的多模态位置编码

Jie Huang, Xuejing Liu, Sibo Song, Ruibing Hou, Hong Chang, Junyang Lin, Shuai Bai

机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04564 2026-04-07 cs.RO cs.CV 74%

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

基于视觉提示的越野制图推理使用多模态大语言模型

Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04473 2026-04-07 cs.CV 70%

Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks

超越标准基准:对视觉-语言模型在不同任务中对自然语义变化鲁棒性的系统审计

Jia Chengyu, AprilPyone MaungMaung, Huy H. Nguyen, Jinyin Chen, Isao Echizen

机构 * Zhejiang University of Technology(浙江工业大学) National Institute of Informatics(国立信息学研究所)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文系统评估了视觉-语言模型在自然对抗场景下的鲁棒性,分析了不同模型在零样本图像分类、语义分割和视觉问答中的表现,揭示了鲁棒CLIP模型放大对抗漏洞的问题。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 67%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI 62%

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04133 2026-04-07 cs.CV cs.AI 62%

Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks

在计算机断层扫描中学习鲁棒的视觉特征以实现临床任务的高效迁移学习

Rubén Moreno-Aguado, Alba Magallón, Victor Moreno, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(帝国理工学院生物工程系与Imperial-X) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Oncology Data Analytics Program, Catalan Institute of Oncology(加泰罗尼亚肿瘤研究所肿瘤数据分析项目) Colorectal Cancer Group, ONCOBELL Program, Institut d’Investigació Biomèdica de Bellvitge(贝尔维特奇生物医学研究所ONCOBELL项目结直肠癌研究组) Consortium for Biomedical Research in Epidemiology and Public Health(流行病学与公共卫生生物医学研究联盟) Department of Clinical Sciences, Faculty of Medicine and Health Sciences, Universitat de Barcelona(巴塞罗那大学医学与健康科学学院临床科学系) Institute of Complex Systems, University of Barcelona(巴塞罗那大学复杂系统研究所) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心肺研究所) Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心) School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VoxelFM,一种基于自蒸馏的3D CT基础模型,通过学习语义丰富的特征,实现了在多种临床任务中无需微调即可高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04357 2026-04-07 cs.CV 57%

Spatially-Weighted CLIP for Street-View Geo-localization

基于空间加权的CLIP用于街景地理定位

Ting Han, Fengjiao Li, Chunsong Chen, Haoling Huang, Yiping Chen, Meiliu Wu

机构 * School of Geospatial Engineering and Science, Sun Yat-Sen University(中山大学地理科学与规划学院) School of Geographical and Earth Sciences, University of Glasgow(格拉斯哥大学地理与地球科学学院) School of System Science and Engineering, Sun Yat-Sen University(中山大学系统科学与工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出空间加权CLIP(SW-CLIP),通过引入空间自相关增强视觉-语言对比学习,改进街景地理定位的准确性与空间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17362 2026-04-07 cs.CV 57%

ATAC: Augmentation-Based Test-Time Adversarial Correction for CLIP

ATAC:基于增强的测试时间对抗修正用于CLIP

Linxiang Su, András Balogh

机构 * University of Szeged(塞格德大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出ATAC方法,通过在CLIP嵌入空间中计算增强诱导的漂移向量,修正嵌入以提高对抗鲁棒性,实验显示其鲁棒性显著优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2604.03995 2026-04-07 cs.CV cs.SD 89%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04229 2026-04-07 cs.MM cs.AI cs.CV cs.SD 85%

Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning

层次化语义相关性感知的掩码自编码器用于无监督音频-视觉表示学习

Donghuo Zeng, Hao Niu, Masato Taya

机构 * KDDI Research, Inc., Saitama, Japan(KDDI研究所,埼玉,日本)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出HSC-MAE框架,通过三级表示层次强制语义一致性,结合教师-学生架构和多任务学习,提升无监督音频-视觉表示学习效果。

Comments 6 pages, 2 tables, 4 figures. Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10882 2026-04-07 cs.CL 83%

Computational emotion analysis with multimodal LLMs: Current evidence on an emerging methodological opportunity

基于多模态大语言模型的计算情感分析:当前对新兴方法论机会的证据

Hauke Licht

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 本文评估了多模态大语言模型在政治视频情感分析中的表现,发现实验室条件下的模型表现接近人类水平,但在真实场景中存在显著性能差距及性别偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29244 2026-04-07 cs.CL cs.LG 79%

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

Thiomi数据集:一个大规模多模态语料库,用于低资源非洲语言

Hillary Mutisya, John Mugane, Gavin Nyamboga, Brian Chege, Maryruth Gathoni

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Thiomi数据集包含超过60万条文本注释和38.5万条音频记录,用于训练和评估ASR、MT和TTS模型,显著提升了非洲语言的语音识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 62%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04093 2026-04-07 cs.HC 50%

BadgeX: IoT-Enhanced Wearable Analytics Meets LLMs for Collaborative Learning

BadgeX:物联网增强型可穿戴分析与大语言模型结合用于协作学习

Zaibei Li, Shunpei Yamaguchi, Qiuchi Li, Daniel Spikol

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 BadgeX结合轻量级可穿戴物联网设备与大语言模型,实现实时协作学习分析,通过多模态传感器数据生成高层面学习洞察。

Comments 4 pages, 2 figures. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03998 2026-04-07 cs.RO 50%

VA-FastNavi-MARL: Real-Time Robot Control with Multimedia-Driven Meta-Reinforcement Learning

VA-FastNavi-MARL:基于多媒体驱动的元强化学习的实时机器人控制

Yang Zhang, Shengxi Jing, Fengxiang Wang, Yuan Feng, Hong Wang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Department of Mechanical and Aerospace Engineering, University of Missouri(密苏里大学机械与航空航天工程系) School of Construction Machinery, Chang’an University(长安大学工程机械学院) Key Laboratory of Intelligent Sensing System and Security (Ministry of Education), Hubei University(湖北大学智能感知系统与安全教育部重点实验室)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出VA-FastNavi-MARL框架,通过元强化学习将异步音频视觉输入统一为潜在表示,实现快速适应未知指令,提升实时控制性能。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

Journal ref 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03612 2026-04-07 cs.CR 50%

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

感知缺口:ASCII艺术与重叠音频作为CAPTCHA

Choon-Hou Rafael Chong

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了利用人类高度专业化神经处理的CAPTCHA任务,提出基于ASCII艺术和重叠音频的两种CAPTCHA类型,测试结果显示现有LLM无法有效解决,表明其在当前有效但可能面临AI发展挑战。

Comments 8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 17 篇

2604.04482 2026-04-07 cs.AI 83%

Scalable and Explainable Learner-Video Interaction Prediction using Multimodal Large Language Models

基于多模态大语言模型的可扩展且可解释的学习者-视频交互预测

Dominik Glandorf, Fares Fawzi, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型预测学习者观看、暂停、跳过和回放行为,以评估视频内容的认知负荷,通过7700万次视频控制事件验证了模型的可扩展性和解释性。

Comments Accepted as long paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 81%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04239 2026-04-07 cs.LG cs.AI q-bio.QM 79%

Good Rankings, Wrong Probabilities: A Calibration Audit of Multimodal Cancer Survival Models

好的排名,错误的概率:多模态癌症生存模型的校准审计

Sajad Ghawami

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究评估了多模态癌症生存模型的校准性,发现其生存概率未经过校准,提出通过Post-hoc Platt缩放可减少误校准,但不改变区分能力。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03685 2026-04-07 cs.CV 79%

DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

DSERT-RoLL:多模态感知用于多样驾驶条件的鲁棒性,结合立体事件-RGB-热成像相机、4D雷达和双光雷达

Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab, KAIST(韩国科学技术院视觉智能实验室)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出DSERT-RoLL数据集,结合立体事件、RGB和热成像相机以及4D雷达和双光雷达,涵盖多样的天气和光照条件,提供精确的2D和3D边界框及轨迹ID,支持跨传感器组合的公平比较,提升新型传感器的数据可用性,并建立统一的3D和2D基准,促进传感器性能的系统研究。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 79%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19010 2026-04-07 eess.SP cs.RO 78%

PalpAid: Multimodal Pneumatic Tactile Sensor for Tissue Palpation

PalpAid:多模态气压触觉传感器用于组织触诊

Devi Yuliarti, Ravi Prakash, Hiu Ching Cheung, Amy Strong, Patrick J. Codd, Shan Lin

机构 * Duke University(杜克大学) Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 PalpAid通过气压和声音传感器恢复机器人手术中的触觉信息,能区分不同硬度的3D打印物体和离体组织。

Comments IEEE-RAS RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04029 2026-04-07 cs.CV 70%

ATSS: Detecting AI-Generated Videos via Anomalous Temporal Self-Similarity

ATSS:通过异常时间自相似性检测AI生成视频

Hang Wang, Chao Shen, Lei Zhang, Zhi-Qi Cheng

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ATSS方法,通过三重相似性表示和跨注意融合机制,检测AI生成视频的异常时间自相似性,优于现有方法,在多个基准上表现更优。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24936 2026-04-07 cs.CV cs.AI 62%

TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization

TIGFlow-GRPO:通过交互感知的流匹配和奖励引导优化进行轨迹预测

Xuepeng Jing, Wenhuan Lu, Hao Meng, Zhizhi Yu, Jianguo Wei

机构 * Tianjin University(天津大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TIGFlow-GRPO,通过交互感知的流匹配和奖励引导优化,提升复杂环境下的轨迹预测准确性与稳定性,生成更符合社会规范和物理可行的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00408 2026-04-07 cs.CV cs.AI 62%

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

基于语义的低比特率视频压缩

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DiSCo框架,通过语义条件扩散模型在低比特率下实现高质量视频压缩,采用文本描述、空间时间退化视频和可选草图等模态,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏