arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 58 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2504.09925 2026-04-30 cs.CV 79%

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26419 2026-04-30 cs.CV cs.AI 62%

Delineating Knowledge Boundaries for Honest Large Vision-Language Models

界定诚实大视觉-语言模型的知识边界

Junru Song, Yimeng Hu, Yijing Chen, Huining Li, Qian Li, Lizhen Cui, Yuntao Du

机构 * Shandong University(山东大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出系统框架提升VLM在面对未知问题时的拒绝能力,通过构建'视觉-不知'数据集并采用监督微调与偏好优化方法,提升事实准确率至67.3%,并在医疗等领域实现泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26462 2026-04-30 cs.CV 57%

A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows

一种多阶段提取流水线用于长扫描金融文档:工业KYC工作流的实证研究

Yuxuan Han, Yuanxing Zhang, Yushuo Wang, Yichao Jin, Kenneth Zhu Ke, Jingyuan Zhao

机构 * OCBC

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出多阶段提取框架,整合图像预处理、多语言OCR、混合页面级检索和紧凑VLM基于结构化提取,提升复杂多页文档的提取精度,实验证明在工业KYC工作中性能优于直接PDF到VLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2604.26453 2026-04-30 cs.CV 89%

Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints

基于属性引导的多模态深度伪造检测:跨模态取证指纹

Wasim Ahmad, Wei Zhang, Xuerui Mao

机构 * School of Interdisciplinary Science, Beijing Institute of Technology, Beijing 100081, China(交叉学科学院,北京理工大学,北京100081,中国)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出AMDD框架,通过跨模态取证指纹一致性损失,引导模型学习生成器特定的取证特征,提升多模态深度伪造检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26568 2026-04-30 cs.CL 74%

Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

多模态大语言模型并非儿科言语语言病理学的全部需求

Darren Fürst, Sebastian Steindl, Ulrich Schäfer

机构 * Ostbayerische Technische Hochschule(奥斯特拜尔技术大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

AI总结 本文提出一种分层方法对儿童语音障碍进行分类,通过微调语音表示模型和数据增强技术,提高了临床任务的性能,证明语音表示模型在各项任务中均显著优于基于大语言模型的最新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 73%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15995 2026-04-30 eess.AS 57%

AILive Mixer: A Deep Learning based Zero Latency Automatic Music Mixer for Live Music Performances

AILive Mixer: 基于深度学习的零延迟自动音乐混音系统用于现场音乐表演

Devansh Zurale, Iris Lorente, Michael Lester, Alex Mitchell

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出一种基于深度学习的自动多轨音乐混音系统,用于现场表演,解决现场表演中通道受相邻乐器声 bleed 影响及音频-视频同步问题,实现零延迟混音。

Comments 5 pages, 4 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26252 2026-04-30 cs.CV 57%

OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction

OmniTrend: 内容-上下文建模用于可扩展的社会流行度预测

Liliang Ye, Guiyi Zeng, Yunyao Zhang, Yi-Ping Phoebe Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出OmniTrend框架,通过分离内容吸引力与上下文曝光,提升跨平台流行度预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 57%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13421 2026-04-30 cs.SD eess.AS 57%

Explainable Detection of Machine Generated Music and Early Systematic Evaluation

可解释性地检测机器生成音乐及早期系统性评估

Yupei Li, Qiyang Sun, Hanqian Li, Lucia Specia, Björn W. Schuller

机构 * Imperial College London, Computing(帝国理工学院伦敦分校,计算机系) Shandong University(山东大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过多种模型评估机器生成音乐检测,揭示ResNet18在领域内和领域外测试中的最佳性能,提出未来研究方向以提升检测方法的鲁棒性和有效性。

Comments Accepted at Scientific report

Journal ref Sci Rep 16, 13757 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2604.26379 2026-04-30 cs.CV 79%

A Multimodal Pre-trained Network for Integrated EEG-Video Seizure Detection

一种用于整合EEG-视频癫痫发作检测的多模态预训练网络

Tong Lu, Ke Xu, Zimo Zhang, Zitong Zhao, Danwei Weng, Ruiyu Wang, Miao Liu, Zizuo Zhang, Jingyi Yao, Yixuan Zhao, Wenchao Zhang, Min Wang, Guoming Luan, Minmin Luo, Zhifeng Yue

机构 * organization= Beijing Institute for Brain Research, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , postcode= 102206 , country= China organization= Chinese Institute for Brain Research, Beijing , city= Beijing , postcode= 102206 , country= China organization= Department of Neurosurgery, SanBo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= GenAns Biotechnology Co., Ltd , city= Beijing , postcode= 102206 , country= China organization= Laboratory for Clinical Medicine, Capital Medical University , city= Beijing , postcode= 100069 , country= China organization= Center of Epilepsy, Beijing Institute for Brain Disorders, Sanbo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= Beijing Key Laboratory of Brain Science

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EEGVFusion框架,结合自监督EEG学习、时空视频编码、最优传输对齐和双向交叉注意力,整合神经和行为证据,实现高准确率的癫痫发作检测,同时降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26247 2026-04-30 cs.IR cs.AI 79%

TimeMM: Time-as-Operator Spectral Filtering for Dynamic Multimodal Recommendation

TimeMM: 时域作为算子的动态多模态推荐谱过滤

Wei Yang, Rui Zhong, Zihan Lin, Xiaodan Wang, Cheng Chen, Huan Ren, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 TimeMM通过时域算子谱过滤框架,解决动态多模态推荐中用户兴趣非平稳性问题,引入自适应谱过滤和模态感知路由,提升推荐性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18662 2026-04-30 cs.RO cs.AI 79%

M2R2: MultiModal Robotic Representation for Temporal Action Segmentation

M2R2:多模态机器人表示用于时序动作分割

Daniel Sliwowski, Dongheui Lee

机构 * Autonomous Systems Lab, Technische Universität Wien (TU Wien)(自主系统实验室,维也纳技术大学) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电研究所,德国航空航天中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出M2R2多模态特征提取器,结合本体感知和体外感知信息,解决时序动作分割中多模态特征复用难题,并在三个机器人数据集上取得新突破。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26330 2026-04-30 eess.SP 78%

Optimizing Tracking Accuracy in Energy-Constrained Multimodal ISAC via Lyapunov-Driven Heterogeneous Mixture-of-Experts

通过Lyapunov驱动的异构专家混合方法优化能量受限多模ISAC的跟踪精度

Wenqi Fan, Ning Wei, Ahmad Bazzi, Rongyan Xi, Zhixian Song, You Li, Zhihan Zeng, Yue Xiu, Chadi Assi

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种物理感知的多模融合感知与通信框架,通过语义信息年龄理论连接网络层排队延迟与物理层空间不确定性,采用Lyapunov驱动的异构专家混合方法优化跟踪后验Cramer-Rao界与系统能量预算,提升跟踪精度和RF鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25942 2026-04-30 cs.LG 78%

A Multimodal and Explainable Machine Learning Approach to Diagnosing Multi-Class Ejection Fraction from Electrocardiograms

一种多模态且可解释的机器学习方法用于从心电图中诊断多类射血分数

Catherine Ning, Yu Ma, Cindy Beini Wang, Sean McMahon, Joseph Radojevic, Steven Zweibel, Dimitris Bertsimas

机构 * Operations Research Center, Massachusetts Institute of Technology(麻省理工学院运营研究中心) Wisconsin School of Business, University of Wisconsin–Madison(威斯康星大学麦迪逊分校商学院) Heart and Vascular Institute, Hartford Hospital(哈特福德医院心脏与血管研究院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种结合工程化12导联ECG时间序列特征与结构化电子健康记录变量的多模态机器学习框架,用于四类临床射血分数分类,并通过SHAP属性分析提高模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 70%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06287 2026-04-30 cs.CV 57%

Perception Test 2025: Challenge Summary and a Unified VQA Extension

2025感知测试挑战:挑战总结及统一视觉问答扩展

Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) University of Bristol(布里斯托大学) University of Oxford(牛津大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26218 2026-04-30 cs.CV 57%

ViBE: Visual-to-M/EEG Brain Encoding via Spatio-Temporal VAE and Distribution-Aligned Projection

ViBE:通过时空VAE和分布对齐投影实现视觉到M/EEG脑编码

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Shuyan Zhou, Guoxu Zhou, Boyu Wang, Jian Zhu, Jinyi Long

机构 * Jinan University(济南大学) The First Affiliated Hospital of Jinan University(济南大学第一附属医院) Western University(西方大学) Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ViBE框架,通过时空卷积变分自编码器和分布对齐投影,实现从视觉刺激生成高质量M/EEG信号,解决跨模态对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2604.18112 2026-04-30 cs.CL cs.MM 88%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13942 2026-04-30 cs.CV cs.AI 85%

Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning

glance-or-gaze: 通过强化学习激励大 multimodal 模型适应性聚焦搜索

Hongbo Bai, Yujin Zhou, Yile Wu, Chi-Min Chan, Pengcheng Wen, Kunhao Pan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :multimodal(title_cn,summary_cn);分类 cs.CV、cs.AI

AI总结 本文提出 glanco-or-gaze 框架,通过强化学习使大 multimodal 模型主动规划视觉搜索,通过选择性注视和复杂度自适应强化学习提升复杂视觉查询性能。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22958 2026-04-30 cs.CV 70%

Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records

对比学习太阳物理图像预训练用于太阳动力学观测记录

Shiyu Shen, Zhe Gao, Taifeng Chai, Yang Huang, Bin Pan

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26467 2026-04-30 cs.CR 67%

Differentially Private Contrastive Learning via Bounding Group-level Contribution

差分隐私对比学习通过限制群体级贡献

Kecen Li, Chen Gong, Zinan Lin, Tianhao Wang, Xiaokui Xiao

专题命中 跨模态检索 :multi-modal(abstract);image-text(abstract)

AI总结 本文提出DP-GCL框架,通过限制梯度依赖提升差分隐私对比学习效果,实验显示在多个数据集上均取得最佳性能,图像分类准确率提升5.6%,图像-文本检索准确率提升20.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2506.02494 2026-04-30 cs.CL cs.AI cs.CV 82%

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26341 2026-04-30 cs.CV 81%

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

SpatialFusion:赋予统一图像生成内在三维几何意识

Haiyi Qiu, Kaihang Pan, Jiacheng Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09547 2026-04-30 cs.CV cs.AI 81%

GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning

GoViG:通过多模态推理实现目标条件视觉导航指令生成

Fengyi Wu, Yifei Dong, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。

Comments Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16552 2026-04-30 cs.CV cs.AI 62%

Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion

通过自回归3D扩散模型生成布局和形状

Zhenggang Tang, Yuehao Wang, Yuchen Fan, Jun-Kun Chen, Yu-Ying Yeh, Kihyuk Sohn, Zhangyang Wang, Qixing Huang, Alexander Schwing, Rakesh Ranjan, Dilin Wang, Zhicheng Yan

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种新的文本到场景生成方法,通过自回归3D扩散模型生成布局和形状,解决文本描述与生成场景不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19216 2026-04-30 cs.NI cs.AI cs.CV cs.LG 62%

Bridging Visual and Wireless Sensing via a Unified Radiation Field for 3D Radio Map Construction

通过统一的辐射场桥接视觉与无线传感以实现3D无线电地图构建

Chaozheng Wen, Jingwen Tong, Zehong Lin, Chenghong Bian, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出URF-GS框架,结合3D高斯散射和反渲染技术,融合多模态数据以提升3D无线电地图的空间频谱精度和样本效率。

Comments The code for this work will be publicly available at: https://github.com/wenchaozheng/URF-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 57%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14082 2026-04-30 cond-mat.mtrl-sci 50%

Generative design of inorganic materials

无机材料的生成设计

Jose Recatala-Gomez, Haiwen Dai, Zhu Ruiming, Nikita Kazeev, Nong Wei, Gang Wu, Maciej Koperski, Tan Teck Leong, Andrey Ustyuzhanin, Gerbrand Ceder, Kostya Novoselov, Kedar Hippalgaonkar

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文探讨了生成设计在无机材料中的应用,结合多模态学习与高通量实验验证,解决功能材料的数据驱动逆向设计难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26065 2026-04-30 cs.RO 50%

FlowS: One-Step Motion Prediction via Local Transport Conditioning

FlowS: 通过局部传输条件实现一步运动预测

Leandro Di Bella, Adrian Munteanu, Bruno Cornelis

机构 * Department of Electronics and Informatics, Vrije Universiteit Brussel(弗拉芒布鲁塞尔自由大学电子与信息系) IMEC

专题命中 多模态生成 :multimodal(abstract)

AI总结 FlowS通过局部传输条件实现一步运动预测,结合在线场景条件学习先验和步一致位移场,提升预测精度与效率,达到SOTA性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏